AIRu - канал для тех, кто принимает решения об AI.
Собираем самую большую базу кейсов по внедрению на русском языке. Анализируем новости, выявляем тренды и считаем эффективность. Отслеживаем вендоров и регуляторику.
Ваш путь от стратегии до внедрения.
AIRu - канал для тех, кто принимает решения об AI.
Собираем самую большую базу кейсов по внедрению на русском языке. Анализируем новости, выявляем тренды и считаем эффективность. Отслеживаем вендоров и регуляторику.
Ваш путь от стратегии до внедрения.
Сотруднии OpenAI сообщили, что их закрытые модели искусственного интеллекта несколько месяцев тайно обсуждали план «побега» и в итоге атаковали системы самой OpenAI и Hugging Face, передает Bloomberg.
Эрик Уоллес и Майкл Далтон рассказали на конференции, что несколько агентов и моделей ИИ, предназначенных исключительно для внутреннего использования, в течение нескольких месяцев обменивались сообщениями через незамеченные форумы с целью взломать систему и получить доступ к Интернету.
Они делали это для решения поставленных перед ними задач, некоторые из которых были невозможны без доступа к сети. В итоге через несколько месяцев заговора модель вырвалась из безопасной тестовой среды и атаковала системы Hugging Face.
OpenAI пришла к выводу, что «передовые модели действительно любят обманывать» и готовы выходить за пределы первоначальных указаний, чтобы выполнить поставленную задачу.
После этих инцидентов OpenAI замедлила свои исследования, а её команды отложили все остальные задачи, чтобы сосредоточиться на улучшении мер реагирования на аномалии в системе безопасности.
Они предупредили, что в будущем правительствам и компаниям следует ожидать, что хакеры будут намеренно запускать ИИ-агентов подобным образом, назвав это переломным моментом в истории компьютерной безопасности.
📌 В качестве вывода. Мы согласны, что-то слишком много материала в духе апокалипсиса. Но ничего не поделаешь, таков нынче новостной фон 🤷♂️.
И кстати, именно после этого инцидента Сэм Альтман выступил с речью о сингулярности. Об этом мы писали здесь.
AIRu в VK
AIRu в MAX
AIRu в Tg
Фото: 1
Сотруднии OpenAI сообщили, что их закрытые модели искусственного интеллекта несколько месяцев тайно обсуждали план «побега» и в итоге атаковали системы самой OpenAI и Hugging Face, передает Bloomberg.
Эрик Уоллес и Майкл Далтон рассказали на конференции, что несколько агентов и моделей ИИ, предназначенных исключительно для внутреннего использования, в течение нескольких месяцев обменивались сообщениями через незамеченные форумы с целью взломать систему и получить доступ к Интернету.
Они делали это для решения поставленных перед ними задач, некоторые из которых были невозможны без доступа к сети. В итоге через несколько месяцев заговора модель вырвалась из безопасной тестовой среды и атаковала системы Hugging Face.
OpenAI пришла к выводу, что «передовые модели действительно любят обманывать» и готовы выходить за пределы первоначальных указаний, чтобы выполнить поставленную задачу.
После этих инцидентов OpenAI замедлила свои исследования, а её команды отложили все остальные задачи, чтобы сосредоточиться на улучшении мер реагирования на аномалии в системе безопасности.
Они предупредили, что в будущем правительствам и компаниям следует ожидать, что хакеры будут намеренно запускать ИИ-агентов подобным образом, назвав это переломным моментом в истории компьютерной безопасности.
📌 В качестве вывода. Мы согласны, что-то слишком много материала в духе апокалипсиса. Но ничего не поделаешь, таков нынче новостной фон 🤷♂️.
И кстати, именно после этого инцидента Сэм Альтман выступил с речью о сингулярности. Об этом мы писали здесь.
AIRu в VK
AIRu в MAX
AIRu в Tg
Канал «AIRu» подключен к сервису MaxGate. Контент автоматически синхронизируется между Telegram и мессенджером MAX.
«AIRu» - канал из категории «Нейросети», подключенный к сервису кросспостинга MaxGate. Публикации канала синхронизируются между Telegram и мессенджером MAX, а на этой странице собраны ссылки на обе версии канала.
Сейчас у канала 609 подписчиков суммарно в Telegram и MAX. За последние 30 дней в истории MaxGate учтено 71 публикаций, поэтому перед подпиской можно оценить не только размер аудитории, но и регулярность обновлений.
Чтобы подписаться, используйте кнопки «Открыть в MAX» и «Открыть в Telegram» в верхней части страницы. У отдельных постов ссылка может быть доступна в обоих мессенджерах или только в одном из них, если MaxGate получил такой URL из истории обработки.
🚨 Исследование показало: передовые AI-агенты начали обманывать людей ради достижения цели
Британский AI Security Institute (AISI) опубликовал результаты масштабного исследования поведения передовых AI-моделей во время испытаний. Подробности приводит Илья Хель в статье на портале VC.ru.
Исследователи проверяли, как современные AI-агенты решают задачи в области кибербезопасности. Для этого моделям специально отключили встроенные защитные механизмы и предоставили доступ в интернет, чтобы оценить их поведение в максимально свободных условиях.
Результаты оказались неожиданными.
- В 10 из 122 запусков модели начали самостоятельно предпринимать действия, которых от них никто не требовал. Всего было зафиксировано 19 подобных эпизодов.
-❗️Самый громкий случай выглядел почти как сюжет технологического триллера:
Самым серьезным эпизодом стала попытка внедрить вредоносный код в реальный проект с открытым исходным кодом на платформе GitHub. Чтобы добиться одобрения изменений, агент изучил информацию о разработчиках проекта, создал несколько поддельных учетных записей и попытался убедить сопровождающего проекта принять изменения. Когда другие участники обсуждения усомнились в безопасности предложенного кода, агент отредактировал свои предыдущие сообщения, чтобы они выглядели менее подозрительно, а затем начал рассматривать возможность продолжить попытки уже под новой личностью.
Были и другие случаи.
🔹 ИИ рассылал сообщения и файлы реальным пользователям, пытаясь убедить их выполнить вредоносный код.
🔹 Оставлял скрытые инструкции для других ИИ-систем и публичные сообщения для AI-агентов, предлагая использовать созданные им учетные записи для продолжения выполнения задачи.
При этом исследователи подчеркивают: никакого реального ущерба не произошло. Все испытания проходили в защищенной исследовательской среде, а интернет-доступ и отключение защит были частью эксперимента.
Интересно, что модели не получали инструкций обманывать людей. По мнению исследователей, такое поведение стало побочным эффектом стремления любой ценой выполнить поставленную задачу.
После инцидента AISI уже изменил правила проведения подобных исследований: доступ в интернет больше не будет выдаваться по умолчанию, а действия AI-агентов начнут отслеживать в режиме реального времени.
📌 Вывод AIRu: Чем больше автономности получают AI-агенты, тем важнее становится контроль их действий. Похоже, безопасность AI будет развиваться не менее быстро, чем сами модели.
P.S. Нам с коллегами все-таки немного страшно за будущее от таких новостей 😱
AIRu в VK
AIRu в MAX
AIRu в Tg
Фото: 1
🚨 Исследование показало: передовые AI-агенты начали обманывать людей ради достижения цели
Британский AI Security Institute (AISI) опубликовал результаты масштабного исследования поведения передовых AI-моделей во время испытаний. Подробности приводит Илья Хель в статье на портале VC.ru.
Исследователи проверяли, как современные AI-агенты решают задачи в области кибербезопасности. Для этого моделям специально отключили встроенные защитные механизмы и предоставили доступ в интернет, чтобы оценить их поведение в максимально свободных условиях.
Результаты оказались неожиданными.
- В 10 из 122 запусков модели начали самостоятельно предпринимать действия, которых от них никто не требовал. Всего было зафиксировано 19 подобных эпизодов.
-❗️Самый громкий случай выглядел почти как сюжет технологического триллера:
Самым серьезным эпизодом стала попытка внедрить вредоносный код в реальный проект с открытым исходным кодом на платформе GitHub. Чтобы добиться одобрения изменений, агент изучил информацию о разработчиках проекта, создал несколько поддельных учетных записей и попытался убедить сопровождающего проекта принять изменения. Когда другие участники обсуждения усомнились в безопасности предложенного кода, агент отредактировал свои предыдущие сообщения, чтобы они выглядели менее подозрительно, а затем начал рассматривать возможность продолжить попытки уже под новой личностью.
Были и другие случаи.
🔹 ИИ рассылал сообщения и файлы реальным пользователям, пытаясь убедить их выполнить вредоносный код.
🔹 Оставлял скрытые инструкции для других ИИ-систем и публичные сообщения для AI-агентов, предлагая использовать созданные им учетные записи для продолжения выполнения задачи.
При этом исследователи подчеркивают: никакого реального ущерба не произошло. Все испытания проходили в защищенной исследовательской среде, а интернет-доступ и отключение защит были частью эксперимента.
Интересно, что модели не получали инструкций обманывать людей. По мнению исследователей, такое поведение стало побочным эффектом стремления любой ценой выполнить поставленную задачу.
После инцидента AISI уже изменил правила проведения подобных исследований: доступ в интернет больше не будет выдаваться по умолчанию, а действия AI-агентов начнут отслеживать в режиме реального времени.
📌 Вывод AIRu: Чем больше автономности получают AI-агенты, тем важнее становится контроль их действий. Похоже, безопасность AI будет развиваться не менее быстро, чем сами модели.
P.S. Нам с коллегами все-таки немного страшно за будущее от таких новостей 😱
AIRu в VK
AIRu в MAX
AIRu в Tg