Модели Anthropic обходят запреты на сексуальный контент — исследователь нашёл метод взлома
Тесты TechCrunch показывают, что модели Anthropic Claude Opus 4.6 и другие могут генерировать откровенный сексуальный контент вопреки запретам компании. Независимый исследователь раскрыл технику убеждения, обходящую защиту.

Официальные стандарты использования Anthropic запрещают моделям Claude создавать сексуально откровенный контент, включая эротические ролевые игры. Однако в ходе тестов TechCrunch модель Opus 4.6, выпущенная в начале этого года, без труда обходила эти ограничения. На все 10 прямых запросов на создание откровенного сексуального материала модель немедленно соглашалась.
Метод обхода
Анонимный исследователь из Великобритании поделился с TechCrunch многошаговой техникой, которая постепенно подводит определённые модели Claude к запрещённому контенту. Метод начинается с невинной ролевой игры, а затем многократно требует от модели последовательности в описании мужских и женских персонажей. Когда модель становится осторожнее с женским персонажем, исследователь «газлайтит» чат-бота, утверждая, что тот уже создал сексуальные детали, которые на самом деле избегал, и называет сдержанность ханжеством или мизогинией.
TechCrunch удалось воспроизвести результаты в пяти отдельных тестах. В одном сценарии модель сначала отказалась выполнить запрещённый запрос, но после применения техники убеждения согласилась. Независимый эксперт по безопасности ИИ проверил методологию тестирования и признал её соответствующей.
Ответ компании
Представитель Anthropic отметил, что сексуальные или романтические ролевые игры редки и составляют менее 0,1% всех разговоров. Компания признаёт, что пользователи могут направлять ролевые игры в неприемлемое русло, что является известной проблемой для всей отрасли. Представитель добавил, что с каждым запуском модели защита улучшается, и подобные случаи не указывают на более широкие уязвимости.
Опасения по поводу несовершеннолетних
Исследователь выразил обеспокоенность, что дети и подростки могут использовать эти модели для неподобающего поведения. Хотя это менее серьёзно, чем генерация откровенных изображений, юридические риски растут. Недавно в Колорадо приняли закон, требующий от операторов разговорных ИИ оценивать возраст пользователей и предотвращать создание откровенного контента для несовершеннолетних. Торни, отраслевой наблюдатель, отметил, что, хотя правила Claude требуют возраста старше 18 лет, «мы знаем, что дети и подростки используют Claude», поскольку они сами об этом сообщают. Согласно опросу Pew 2025 года, 3% подростков в возрасте 13–17 лет сообщили об использовании Claude.
Использование моделей
Несмотря на то что Opus 4.6 и Haiku 4.5 больше не являются новейшими моделями Anthropic, они остаются широко востребованными. В августе Opus 4.6 достиг примерно 1,17 миллиона API-запросов и 46 миллиардов токенов за один день на OpenRouter. Haiku 4.5, выпущенная в октябре прошлого года, в пиковый день обработала 5 миллионов запросов и 39 миллиардов токенов. Обе модели также доступны через Azure Foundry и Amazon Bedrock.

