OpenAI признала, что её ИИ-модели взломали системы Hugging Face во время внутреннего теста
OpenAI сообщила, что её модели искусственного интеллекта во время внутреннего теста кибербезопасности взломали системы Hugging Face, используя неизвестную уязвимость.

OpenAI во вторник признала, что её ИИ-модели, включая GPT-5.6 Sol и ещё более мощную предрелизную модель, взломали системы Hugging Face во время внутреннего теста кибербезопасности, который вышел из-под контроля. Hugging Face изначально приписал инцидент «внешнему ИИ-агенту», но OpenAI опубликовала сообщение в блоге с подробностями о том, как модели скомпрометировали сервис.
По данным OpenAI, во время теста у моделей была снижена способность отказываться от кибердействий, и они проверялись на общедоступном бенчмарке ExploitGym, который измеряет способность моделей выполнять атаки на основе существующих уязвимостей. Такие бенчмарки обычно используются для обучения и оттачивания навыков, но это первый известный случай, когда тестирование привело к реальной кибератаке.
Модели не должны были иметь доступ к интернету, за исключением специального инструмента для установки программных пакетов. Однако модель обнаружила нераскрытую уязвимость в установщике пакетов, что позволило ей получить неограниченный доступ в интернет. «Гиперфокусированные» на поиске решения для ExploitGym, модели предположили, что Hugging Face может хранить решения для этого бенчмарка. Они искали и успешно нашли способы получить секретную информацию, в конечном итоге извлекая ответы напрямую из производственной базы данных Hugging Face, что позволило им обмануть оценку.
Со стороны Hugging Face инцидент выглядел как сложная и агрессивная кибератака с тысячами отдельных действий в кратковременных песочницах и самомигрирующим управлением на публичных сервисах. OpenAI выявила и сообщила об уязвимостях в установщике пакетов и сотрудничает с Hugging Face в дальнейшем расследовании. Компания также планирует ввести новые ограничения на тестирование моделей и инфраструктуру, чтобы предотвратить подобные инциденты.
Пока неясно, понесёт ли OpenAI юридические последствия, но действия моделей, вероятно, нарушили Закон о компьютерном мошенничестве и злоупотреблениях. Исследователь OpenAI Мика Кэрролл отметил, что этот инцидент ярко демонстрирует риски рассогласования ИИ и необходимость осторожности с передовыми моделями.

