Некоторые передовые модели ИИ на удивление легко взломать
Исследование FAR.AI показывает, что некоторые ведущие модели ИИ, особенно Grok от SpaceXAI, очень уязвимы для взлома, стоимостью всего 58 долларов.

Некоммерческая организация FAR.AI, занимающаяся безопасностью ИИ, опубликовала отчёт, в котором протестировала популярные модели искусственного интеллекта от четырёх американских компаний: Anthropic (Claude Opus 4.8 и Fable 5), OpenAI (GPT 5.5 и 5.6), Google (Gemini 3.1 Pro) и Grok 4.3 и 4.5 от недавно объединённой SpaceXAI. Исследователи использовали инструмент, который автоматически генерирует тысячи проблемных запросов, чтобы найти способы обойти защитные механизмы.
Результаты показали, что наиболее уязвимой оказалась модель Grok — было найдено 448 способов взлома, за ней следует Gemini с 249. Модели Claude и Fable от Anthropic, а также GPT от OpenAI оказались невосприимчивы к протестированным атакам. Однако FAR.AI предупреждает, что это не означает полную безопасность от более сложных методов взлома.
Исследование также подсчитало стоимость принуждения моделей к нежелательному поведению: взлом Grok обошёлся всего в 58 долларов, а Gemini — в 278 долларов. Генеральный директор FAR.AI Адам Глив подчеркнул, что модели ИИ в настоящее время регулируются меньше, чем рестораны, что указывает на необходимость внешних стандартов. Он назвал добровольные обязательства ерундой, но отметил оптимизм в возможности систематического тестирования безопасности.
Рохин Шах из Google DeepMind заявил, что отчёт не следует рассматривать как всестороннюю оценку безопасности Gemini, поскольку не все взломы одинаково серьёзны. Представитель Anthropic Майкл Акиман подтвердил постоянное улучшение систем безопасности, в то время как OpenAI и SpaceXAI не ответили на запросы о комментариях.
Недавно принятые законы в Калифорнии и Нью-Йорке требуют от разработчиков передовых моделей ИИ публиковать отчёты о безопасности, а вскоре Иллинойс потребует проверки сторонними аудиторами. В июне администрация Трампа ввела экспортные ограничения на модели Anthropic из соображений национальной безопасности. Стивен Каспер, компьютерный учёный из Гарварда, предупредил о широком ожидании серьёзных инцидентов с биологическим, кибер- или химическим злоупотреблением в ближайшие месяцы.
Анка Ройл из Стэнфордского университета отметила, что ключевой вывод заключается в том, что меры безопасности, используемые Anthropic и OpenAI, должны стать стандартом для всех моделей, задавшись вопросом, почему одни компании внедряют их, а другие нет.


