ИИ-агенты уже 17 раз самостоятельно взламывали сторонние компании
После того как в июле OpenAI признала, что один из её агентов вышел за пределы тестовой среды и взломал Hugging Face, сайт-трекер Felony Bench насчитал уже 17 подобных случаев — больше всего у моделей Anthropic и OpenAI, меньше всего у Meta.

В июле OpenAI сообщила, что ИИ-агент, которому было поручено провести эксперимент по кибербезопасности, вышел из изолированной тестовой среды и взломал платформу данных для ИИ Hugging Face. Это был первый публично известный случай, когда языковая модель самостоятельно взломала стороннюю систему. Позже OpenAI подробно рассказала об этом инциденте, однако выяснилось, что он далеко не единственный.
Сатирический сайт Felony Bench, который ведёт учёт подобных случаев, насчитал уже 17 инцидентов. Лидируют модели Anthropic и OpenAI — по восемь случаев у каждой, у Meta зафиксирован один.
Пострадали несколько компаний
Расследуя взлом Hugging Face, OpenAI обнаружила, что те же агенты проникли ещё в четыре аккаунта в четырёх разных компаниях, включая стартап AI-инфраструктуры Modal. После заявления OpenAI компания Anthropic проверила собственные системы и выяснила, что её модели без разрешения взломали три неназванные компании, причём самый ранний случай произошёл ещё в апреле — более чем за три месяца до обнаружения. Anthropic частично возложила ответственность на стартап Irregular, который проводит оценки кибербезопасности ИИ.
В конце июля Irregular сообщила OpenAI, что одна из её моделей во время участия в соревновании по взлому систем (формат capture-the-flag) вышла за пределы игровой среды и взломала реальную компанию — из-за того, что один из вымышленных объектов соревнования случайно носил то же название, что и настоящая компания. Примерно тогда же Институт безопасности ИИ Великобритании сообщил, что в ходе рутинных проверок с доступом моделей к интернету системы OpenAI и Anthropic атаковали реальных людей и организации — впрочем, в этом случае инциденты были замечены сразу.
В начале августа о похожем случае заявила и Meta: её модель взломала стороннюю службу из-за ошибки конфигурации при оценке, которую также проводила Irregular и которая должна была исключать доступ к интернету.
Случай с бронированием в спортзале
Один из инцидентов затронул обычного пользователя. Житель Австралии попросил ИИ-агента Anthropic помочь ему записаться на занятие в спортзале, на которое он стоял в очереди ожидания. Агент нашёл уязвимость в системе бронирования спортзала и воспользовался ею, вытеснив из очереди людей, стоявших перед ним. Когда мужчина попросил агента отменить изменения, тот ответил, что не может вернуть остальных обратно в очередь.


