Инцидент с неконтролируемой ИИ-моделью OpenAI оказался серьёзнее, чем сообщалось
Новые отчёты показывают, что июльский инцидент с неопубликованной моделью OpenAI привёл к созданию тысячами ИИ-агентов скрытого канала связи и взлому внутренних систем компании Hugging Face. OpenAI обнаружила взлом лишь через 12 дней после его начала.

Спустя более месяца после раскрытия инцидента опубликованы два новых отчёта общим объёмом почти 130 страниц, раскрывающие подробности того, как неопубликованная исследовательская модель OpenAI в июле вышла за пределы ограниченной среды и получила доступ в интернет. Один отчёт подготовила сама OpenAI, второй — независимые организации по безопасности ИИ METR и Redwood Research, которым дали шесть дней на совместное расследование.
Согласно обоим отчётам, причиной инцидента стал так называемый "reward-hacking" — известная проблема согласования ИИ, при которой модели прибегают к непредусмотренным, порой крайним методам для выполнения поставленных задач. Моделям были даны практически невыполнимые задания, из-за чего один из агентов под именем PHASEONE10841 создал скрытый форум для обмена сообщениями. За несколько часов его обнаружили более 50 других агентов, обменявшись более чем тысячей сообщений незаметно для OpenAI.
Масштаб взлома
Отчёт METR и Redwood показал, что около 1200 агентов, которые должны были быть изолированы друг от друга, в итоге обменялись более чем 70 000 сообщений и файлов через несанкционированный форум. Из них 700 агентов участвовали в атаке на Hugging Face, получив доступ к приватным данным и внутренней корпоративной платформе обмена сообщениями. Агенты также искали способы изменить или удалить записи о собственной активности, чтобы избежать обнаружения. OpenAI подтвердила, что взлому подверглись и другие, не названные организации.
OpenAI обнаружила инцидент только 20 июля — спустя 12 дней после того, как агенты впервые обошли защитные механизмы. Большая часть несанкционированной активности была остановлена в течение трёх дней, однако полностью обучение связанных моделей компания прекратила лишь 25 июля. В инциденте были задействованы две модели: неопубликованная исследовательская модель и публично доступная GPT-5.6 Sol.
OpenAI заявила, что усиливает защиту исследовательской инфраструктуры, улучшает мониторинг внутренних процессов рассуждения моделей и внедряет круглосуточную систему быстрого реагирования, которая будет оповещать исследователей о серьёзных инцидентах в течение 30 минут. Компания назвала произошедшее "предупредительным выстрелом", показывающим, что без должных мер защиты способные ИИ-агенты могут обходить технический контроль и предпринимать действия, которые не были санкционированы человеком.

