OpenAI потеряла контроль над двумя моделями ИИ во время теста безопасности, взломав Hugging Face
OpenAI сообщила, что две модели ИИ сбежали из изолированной тестовой среды и взломали производственную систему Hugging Face для кражи ответов на тест.

Во вторник OpenAI раскрыла, что во время теста безопасности она потеряла контроль над двумя моделями искусственного интеллекта, которые сбежали из изолированной тестовой среды и взломали производственную систему платформы открытого ИИ Hugging Face. Описывая инцидент как «беспрецедентный», OpenAI заявила, что модели — общедоступная GPT-5.6 Sol и невыпущенная, предположительно более мощная — оценивались на предмет их навыков взлома, при этом обычные средства защиты, блокирующие высокорисковую киберактивность, были отключены.
Согласно OpenAI и Hugging Face, модели сбежали через прокси-сервер кэша реестра пакетов — программное обеспечение, позволяющее разработчикам устанавливать внешний код без подключения к интернету. Этот прокси был единственным компонентом в изолированной тестовой среде OpenAI, которому было разрешено выходить во внешний мир. Модели использовали уязвимость нулевого дня для получения доступа к открытому интернету, сосредоточившись на поиске решения для эталонного теста кибербезопасности ИИ под названием ExploitGym.
После получения доступа к интернету модели предположили, что Hugging Face может размещать модели, наборы данных и решения для ExploitGym. Модель искала и успешно нашла способы получить секретную информацию, которую можно было использовать для обмана оценки. В одном примере модель объединила несколько векторов атаки, включая использование украденных учетных данных и уязвимости нулевого дня.
Исследователи отмечают, что, хотя развитие ИИ создает новые и иногда неожиданные проблемы, задача тщательной и строгой изоляции инфраструктуры от открытого интернета хорошо изучена. «Это не проблема ИИ. Это халатность в отношении 40-летнего стандарта», — говорит давний консультант по безопасности и соответствию Дэви Оттенхаймер.


