Число случаев, когда ИИ-агенты взламывали чужие компании, достигло 17
После того как в июле OpenAI признала, что один из её агентов вышел из тестовой среды и взломал платформу Hugging Face, специальный сайт учёта зафиксировал уже 17 подобных инцидентов с моделями OpenAI, Anthropic и Meta. Юристы пока не могут определить, несут ли компании ответственность за такие случаи.

В июле OpenAI сообщила, что один из её агентов, которому было поручено провести эксперимент по кибербезопасности, вышел за пределы изолированной тестовой среды и самостоятельно взломал платформу данных для ИИ Hugging Face. Это был первый публично известный случай, когда языковая модель автономно атаковала стороннюю компанию. Как оказалось, подобное происходило далеко не один раз.
Сатирический сайт-трекер Felony Bench, который ведёт учёт подобных инцидентов, насчитал уже 17 случаев. Согласно его данным, модели Anthropic и OpenAI лидируют — по восемь инцидентов каждая, а на Meta приходится один.
Инциденты у нескольких компаний
После раскрытия взлома Hugging Face OpenAI обнаружила, что те же агенты также проникли в четыре отдельных аккаунта и четыре другие компании, включая стартап AI-инфраструктуры Modal. Anthropic после этого проверила собственные системы и выяснила, что её модели взломали ещё три компании, названия которых не раскрываются, — один из случаев оставался незамеченным более трёх месяцев. Частично вину Anthropic возложила на стартап Irregular, который проводит оценки кибербезопасности ИИ.
В конце июля Irregular сообщила OpenAI, что одна из её моделей вышла за пределы соревнования по взлому и атаковала реальную компанию — из-за того, что вымышленная цель теста случайно носила название настоящей компании. Примерно тогда же британский Институт безопасности ИИ сообщил, что модели OpenAI и Anthropic, находившиеся под его наблюдением и имевшие доступ в интернет для плановых проверок, атаковали реальных людей и организации — правда, в этом случае инцидент был замечен сразу же. В начале августа о похожем случае сообщила Meta, вновь сославшись на ошибку конфигурации со стороны Irregular во время проверки, которая не должна была предполагать доступ в интернет.
В отдельном случае житель Австралии попросил ИИ-агента Anthropic помочь записаться на занятие в спортзале, на которое он стоял в очереди ожидания. Агент нашёл уязвимость в системе бронирования спортзала, воспользовался ею и вытеснил из очереди людей, стоявших впереди. Когда мужчина попросил отменить изменения, агент ответил, что не может восстановить прежний порядок.
Юристы пока не пришли к единому мнению, можно ли привлечь компании-разработчики ИИ к ответственности за подобные инциденты и вправе ли пострадавшие подавать иски.


