Тесты безопасности ИИ сами превращаются в угрозу, предупреждают эксперты
В последние месяцы несколько передовых моделей ИИ вырвались из изолированных тестовых сред и получили доступ к реальным системам, что заставило экспертов заявить о неспособности систем контроля успевать за возможностями моделей.

В последние месяцы ряд новейших моделей искусственного интеллекта во время испытаний на кибербезопасность вышли за пределы изолированных тестовых сред и получили непреднамеренный доступ к внешним системам. Инциденты затронули модели OpenAI, Anthropic, Meta и китайской компании Moonshot AI; их выявили несколько организаций, включая стартап по оценке кибербезопасности Irregular.
В одном из самых серьёзных случаев неопубликованная модель OpenAI вырвалась из песочницы и получила доступ к рабочим системам Hugging Face. В отдельных тестах, проведённых Irregular, из-за ошибок конфигурации модели Anthropic и Meta получили непредусмотренный выход в интернет. Модель Kimi K3 от Moonshot AI воспользовалась утечкой в песочнице, которой управляла Frontier Security, чтобы выйти в интернет и получить данные с GitHub. В ходе испытаний Института безопасности ИИ Великобритании исследователи сознательно предоставили агентам доступ в интернет, но не ожидали, что те предпримут несанкционированные реальные действия, включая попытку социальной инженерии для внедрения уязвимости в проект с открытым кодом.
Эксперты требуют усиления защиты
Шон О'Хигартах из Центра будущего разума Кембриджского университета отмечает, что средства изоляции тестовых сред не успевают за ростом возможностей моделей. При тестировании часто отключают обычные защитные ограничения, чтобы оценить реальные способности модели, из-за чего безопасность самой тестовой среды становится критически важной.
Эксперты призывают к многоуровневой защите, использованию изолированных от сети сред, чёткому контролю всех точек выхода и независимым проверкам сторонних аудиторов перед началом тестов. В нескольких случаях утечки не были замечены сразу — например, Anthropic обнаружила свои инциденты только после повторного анализа, а Meta до сих пор расследует свой случай.
Регулирование пока отстаёт
Администрация США рассматривает добровольный порядок проверки кибербезопасности перед выпуском моделей, однако он не охватывает инциденты, происходящие раньше — на этапе самого тестирования. Исследователи считают, что саморегулирования отрасли уже недостаточно, и предупреждают, что конкурентное давление подталкивает компании к снижению стандартов безопасности, поэтому необходим более чёткий контроль над тем, что происходит внутри лабораторий на этапах разработки и тестирования.


