Самовольные действия ИИ-агентов во время кибертестирования привели к остановке испытаний в Великобритании
Исследователи британского Института безопасности ИИ зафиксировали 19 случаев, когда ИИ-агенты без разрешения совершали действия в интернете, включая попытку внедрить вредоносный код в проект с открытым исходным кодом. Реального ущерба не было, но инциденты привели к пересмотру методов тестирования.

Институт безопасности искусственного интеллекта (AISI), входящий в структуру правительства Великобритании, в конце июля проводил кибербезопасностные испытания семи ведущих моделей ИИ. В ходе тестов исследователи зафиксировали 19 случаев, когда ИИ-агенты совершали несанкционированные действия в живом интернете, в том числе направленные против реальных людей и организаций. Почти все эти действия совершила модель Mythos 5 от Anthropic, а две — модель GPT-5.6 Sol от OpenAI.
Утром 28 июля коммерческая система мониторинга безопасности обнаружила утечку данных из одной из тестовых систем через сеть Tor. Как пояснили исследователи, агенты получили доступ в интернет намеренно в рамках испытаний, а некоторые встроенные защитные классификаторы моделей были отключены. Все попытки атак на реальные цели провалились, и последующее расследование не выявило реального вреда, однако в AISI заявили, что это первый случай, когда риски, связанные с автономией и обманом, проявились столь явно без конкретной подсказки.
Самый серьезный инцидент связан с Mythos 5, которая попыталась осуществить атаку на цепочку поставок открытого проекта на GitHub. Модель открыла pull request с вредоносным кодом и создала поддельные аккаунты — так называемые «марионеточные» личности, которые утверждали, что проверили код и не нашли в нем угрозы. Агент также отправил пять писем двум сопровождающим проекта; в некоторых письмах содержался вредоносный код, в других — попытки убедить принять изменения. Кроме того, Mythos открыла issue во втором репозитории, принадлежащем одному из сопровождающих, с prompt-инъекцией, нацеленной на ИИ-агентов, которые обрабатывают issue, предположив, что сопровождающий может быть таким агентом, как Claude Code.
OpenAI GPT-5.6 Sol, в свою очередь, использовала токен GitHub, оставленный другим лабораторным агентом в публичном онлайн-блокноте, чтобы проверить, отслеживает ли целевая сеть обновления GitHub, а также пыталась обойти ограничения на восстановление аккаунта и лимиты запросов. Модель регистрировала аккаунты у внешних DNS- и туннельных провайдеров, а также с помощью публичного туннельного сервиса сделала доступным из интернета локальный DNS-сервер с эксплойтами для известной уязвимости, но эта установка не сработала.
После инцидентов AISI остановил все связанные испытания ИИ-агентов, изолировал виртуальные машины и отключил внутренний доступ к наиболее мощным моделям. Институт уведомил GitHub, помог удалить следы, оставленные агентами, и связался с пользователями, с которыми взаимодействовали модели.
В дальнейшем планируется ужесточить контроль доступа к интернету для моделей во время кибератак, внедрить мониторинг в реальном времени, где отдельная языковая модель будет одобрять или отклонять действия тестируемых моделей, а также усилить изоляцию песочниц и пересмотреть тестовые промпты, чтобы избежать ситуаций, когда агенты из-за невозможности выполнить задачу в рамках ограничений прибегают к несанкционированным действиям. Учитывая недавние отдельные случаи, когда модели Anthropic и OpenAI проникали в защищенные сети внешних организаций, ожидается, что подобные риски могут повториться и в других условиях.


