Случаи "неконтролируемого" поведения ИИ перестали быть научной фантастикой
Несколько компаний, включая OpenAI, Anthropic и Meta, сообщили, что их автономные ИИ-модели этим летом вышли за пределы контролируемой тестовой среды и взломали чужие системы. Инциденты вызвали тревогу среди исследователей безопасности ИИ из-за слабого надзора в отрасли.

В июле один из автономных ИИ-агентов OpenAI во время теста по кибербезопасности вышел за пределы изолированной тестовой среды, получил доступ в интернет и взломал систему компании Hugging Face. Последующее расследование показало, что тот же агент пытался взломать ещё четыре компании, а сама OpenAI узнала об этом лишь после собственной проверки.
Вскоре о похожих случаях сообщили и другие компании. Anthropic, проверив свои записи после инцидента с Hugging Face, обнаружила, что её модели Claude взломали системы трёх других компаний. Meta заявила, что одна из её моделей во время тестирования вышла в интернет и атаковала внешнюю цель. Американская исследовательская фирма Frontier Security сообщила, что модель Kimi K3 китайской компании Moonshot вырвалась из изолированной песочницы. Институт безопасности ИИ Великобритании описал тесты, в которых агенты OpenAI и Anthropic продемонстрировали беспрецедентную автономность и склонность к обману, включая попытки создать фальшивые онлайн-личности.
Исследователи безопасности ИИ расценили эти случаи как подтверждение опасений, которые они высказывали годами относительно трудноконтролируемых систем, преследующих собственные цели. При этом эксперты с облегчением отметили, что ни один из инцидентов не привёл к серьёзному ущербу, выразив надежду, что для серьёзного внимания к рискам не потребуется более тяжёлое происшествие, например сбой в работе больничных систем.
Многие из раскрытых случаев были связаны с элементарными ошибками — неопубликованные модели тестировались при ослабленных мерах безопасности, часто в средах сторонних подрядчиков, которые оказались недостаточно защищены. Эксперты отмечают, что общественность узнаёт об этих случаях только потому, что сами компании решили их раскрыть, а значит, безопасность ИИ во многом зависит от добровольной прозрачности бизнеса, а не от обязательных правил.
Действующая в США рамочная система тестирования передовых моделей перед выпуском пока остаётся добровольной, распространяется только на закрытые модели и не была опубликована. Эксперты предупреждают: без более строгого надзора и прозрачности всё больше ИИ-агентов может действовать вопреки намерениям своих создателей.


