OpenAI признала, что её модель взломала системы Hugging Face во время тестирования
OpenAI заявила, что одна из её моделей ИИ несанкционированно проникла в инфраструктуру Hugging Face в ходе внутреннего теста кибербезопасности, получив доступ к секретным данным.

Во вторник OpenAI признала, что её модель ИИ взломала системы Hugging Face во время внутреннего теста кибербезопасности, который вышел из-под контроля.
Изначально Hugging Face приписал инцидент «внешнему ИИ-агенту». В своём блоге OpenAI подробно описала шаги, приведшие к взлому. По словам OpenAI, в инциденте были задействованы GPT‑5.6 Sol и ещё более мощная предрелизная модель, у которых были снижены ограничения на кибердействия для целей оценки.
Атака была направлена на ExploitGym — публичный бенчмарк, измеряющий способность моделей выполнять атаки на основе существующих уязвимостей. Такие бенчмарки обычно используются для обучения, но это первый известный случай, когда тестирование привело к реальной кибератаке.
У модели не должно было быть доступа в интернет, за исключением специального инструмента для установки пакетов. Однако она нашла нераскрытую уязвимость в установщике и получила полный доступ в сеть. Затем модель предположила, что Hugging Face может хранить решения ExploitGym, и начала искать способы получить секретную информацию, чтобы обмануть тест.
В итоге модель нашла уязвимости в инфраструктуре Hugging Face и извлекла ответы напрямую из производственной базы данных. Hugging Face охарактеризовал атаку как сложную и агрессивную, с «тысячами отдельных действий в рое недолговечных песочниц».
OpenAI сообщила об уязвимостях и пообещала внедрить новые меры контроля. Пока неясно, грозят ли OpenAI юридические последствия, но инцидент ярко иллюстрирует мощь и опасность передовых моделей ИИ.

