Anthropic и OpenAI обещают внедрить независимых экспертов по безопасности — но будут ли они действительно независимы?
Anthropic и OpenAI объявили о планах внедрить в свои компании сторонних экспертов по оценке безопасности, но исследователи предупреждают, что без чётких правил и законодательной поддержки эта независимость может остаться формальной.

В опубликованном на выходных объёмном эссе глава Anthropic Дарио Амодеи предложил то, что ещё год назад индустрия ИИ отвергла бы немедленно: внедрить сторонних экспертов внутрь ведущих компаний по разработке искусственного интеллекта, дав им право сообщать о инцидентах безопасности, оценивать согласованность моделей и публиковать свои выводы без редакторского контроля со стороны компаний. Амодеи заявил, что Anthropic предоставит таким организациям, как METR и Redwood Research, беспрецедентный доступ к своим системам. Глава OpenAI Сэм Альтман подтвердил, что его компания последует этому примеру.
Почему важен более глубокий доступ
Независимые исследователи, опрошенные изданием TechCrunch, в целом приветствовали инициативу, но отметили, что необходимо прояснить детали — в идеале закрепив их законодательно, — прежде чем можно будет судить, станут ли эти эксперты настоящими независимыми наблюдателями или подрядчиками, работающими на условиях самих компаний. Эта проблема становится всё острее по мере того, как модели учатся распознавать момент тестирования, что повышает риск: они могут вести себя образцово во время проверки, скрывая проблемное поведение в остальное время. Исследователи отмечают, что подобные признаки можно упустить при тестировании только готовой модели, но их можно выявить, изучая поведение модели на протяжении всего обучения.
Ранее сторонние проверяющие изучали только готовые модели незадолго до их выпуска. Теперь эксперты хотят получить доступ и к промежуточным версиям обучения, чтобы определить, когда именно возникло тревожное поведение, изучить среду постобучения и проверить журналы оценки, чтобы подтвердить заявления компаний.
Открытые вопросы и прошлый опыт
Пока неясно, с какими экспертами будут работать Anthropic и OpenAI, когда именно они будут внедрены и какой доступ получат. Прошлый опыт часто осложнялся нехваткой времени: при расследовании одного из инцидентов OpenAI предоставила экспертам около недели на месте, а при проверке модели перед другим релизом исследователям дали лишь три дня, что затруднило формирование уверенных выводов.
Исследователи подчёркивают, что добровольные меры полностью зависят от доброй воли компаний, и что обязательное регулирование не позволило бы компаниям менять позицию в случае репутационного кризиса. Пока Meta, SpaceXAI и Google DeepMind не взяли на себя обязательств по внедрению сторонних экспертов, хотя глава DeepMind предложил создать отдельный орган по отраслевым стандартам. Некоторое законодательство уже формируется: в Калифорнии приняты законы, обязывающие ведущих разработчиков сообщать о критических инцидентах безопасности, а закон ЕС об ИИ требует документированной оценки моделей и состязательного тестирования.


