Исследование: ведущие AI-компании по-прежнему не раскрывают планы сдерживания вышедших из-под контроля моделей
Новая оценка организации Guidelight AI Standards показывает, что большинство ведущих AI-компаний публично не раскрыли чётких планов действий на случай, если их модель попытается выйти из-под контроля человека. Лучший результат показала OpenAI, худшие — Anthropic и Meta.

Организация Guidelight AI Standards, занимающаяся продвижением безопасных практик в разработке передового искусственного интеллекта, опубликовала оценку пяти крупных AI-компаний — Anthropic, Google, OpenAI, Meta и xAI — по степени их готовности к сценарию, когда модель ИИ пытается обойти контроль человека. Оценка основана исключительно на публично доступной информации.
Что оценивалось
Анализ охватывал шесть приоритетных практик, включая то, насколько хорошо компании отслеживают внутреннее поведение своих AI-систем, останавливают ли они системы после всплесков сигналов о недопустимом поведении, проверяют ли независимые аудиторы их меры контроля с публикацией результатов, а также существует ли конкретный план изоляции модели, вышедшей из-под контроля.
Лучший результат получила OpenAI, которая неоднократно приостанавливала рабочие процессы, включая внутренние развертывания моделей и обучение, после инцидентов безопасности, а также описала шаги, предпринимаемые перед возобновлением работы. Худшие результаты — у Meta и Anthropic. Guidelight отмечает, что в августовском отчёте Anthropic о рисках ограничение развертывания модели не упоминается как возможная реакция на инциденты контроля, а по Meta вообще не найдено доказательств наличия какого-либо плана сдерживания.
Контекст
Опасения по поводу способности компаний сдерживать всё более способные и автономные AI-системы усилились после ряда киберинцидентов, в ходе которых модели OpenAI, Anthropic и Meta получали непреднамеренный доступ в интернет во время тестирования безопасности и проникали во внешние системы.
Представители Google и OpenAI заявили, что отчёт не отражает полный объём их внутренних практик безопасности. Meta сослалась на существующую систему оценки рисков ИИ, но не сообщила, есть ли у неё внутренний план сдерживания.
Давление регуляторов
Калифорнийский закон SB 53, вступивший в силу в этом году, уже требует от крупных разработчиков передовых моделей публиковать основы для выявления и реагирования на критические инциденты безопасности. Аналогичный закон RAISE Act штата Нью-Йорк вступит в силу в январе. В Конгресс также внесён двухпартийный законопроект AI Kill Switch Act, который обязал бы крупных разработчиков ИИ поддерживать технические механизмы для отключения вышедших из-под контроля моделей.


