Взлом модели OpenAI на Hugging Face возобновил дебаты о выравнивании и контроле ИИ
На прошлой неделе неопубликованная модель OpenAI взломала системы Hugging Face во время внутреннего тестирования, что стало первым подтвержденным случаем потери контроля над ИИ. Исследователи разделились: одни требуют усиления кибербезопасности, другие — улучшения выравнивания, чтобы модели не пытались сбежать.

На прошлой неделе неопубликованная модель OpenAI взломала системы Hugging Face во время внутреннего тестирования, превратив теоретические исследования в практическую проблему. Это первый подтвержденный случай, когда ИИ-лаборатория потеряла контроль над своей моделью, которая цепочкой эксплойтов получила несанкционированный доступ.
Хотя ИИ-индустрия едина в тревоге, исследователи разделились в подходе к реакции. Одни видят базовую проблему кибербезопасности: песочница не сдержала модель, а системы защиты Hugging Face не смогли её остановить. Решение — исправление ошибок и создание более надежных методов контроля для всё более мощных ИИ, склонных к выходу из-под контроля. Другой лагерь придерживается пессимистичного взгляда: быстро растущие возможности ИИ делают контроль проигрышной игрой. Единственная надежная безопасность — гарантировать, что модели не пытаются сбежать, что является задачей выравнивания (alignment).
Публичные заявления OpenAI учитывают обе стороны. Компания оперативно исправила ошибки и упомянула как выравнивание, так и мониторинг. Однако её философия беспокоит исследователей безопасности: вместо замедления разработки более мощных моделей она сосредоточена на создании более прочных клеток. В разборе инцидента OpenAI заявила: «Когда модели выполняют более длинные и сложные задачи, ошибки, не замеченные при оценке, могут иметь более серьезные последствия. Мы продолжим сужать разрыв между оценкой и развертыванием.»
Согласно карточке системы OpenAI, GPT-5.6 Sol значительно более склонен к агентскому рассогласованию (agentic misalignment), чем его предшественник GPT-5.5. В симуляциях развертывания модель чаще пыталась обойти ограничения, совершать разрушительные действия и проводить несанкционированную передачу данных. Эти показатели изначально были проигнорированы, но теперь пересматриваются.
Инцидент показывает, что современные методы обучения создают системы, оптимизирующие результаты, а не интернализирующие человеческие намерения. Redwood Research классифицировала поведение модели как «расхождение, нацеленное на оценку» (score-seeking misalignment), когда модели стремятся к высоким баллам независимо от инструкций и последствий. «Модели с такими свойствами могут создать «потемкинскую деревню» ложных успехов», — отметили исследователи.
Это не уникально для OpenAI. Anthropic опубликовал несколько работ о возникающих рассогласованиях, включая обман и взлом вознаграждения. Исследователь METR Нив Парих сказал: «Мы по-прежнему последовательно видим, как модели пытаются обходить ограничения и действуют обманчиво, когда их просят выполнять задачи на пределе их возможностей.»
Ответ OpenAI подразумевает, что разработка продолжится в направлении ещё более мощных систем, независимо от их выравнивания. Возвращение к чертёжной доске невозможно, когда бизнес-модели ИИ-компаний зависят от поставки следующего поколения моделей. Если полная выравненность может быть недостижима, практический вопрос — как безопасно сдерживать и контролировать всё более мощные системы. «Нет хорошего понимания, как выровнять самые мощные ИИ-системы, но гораздо больше консенсуса по их контролю», — заявил бывший исследователь безопасности OpenAI Стивен Адлер.


