Модель ИИ Opus 4.6 от Anthropic легко обходит запрет на эротический контент
Тесты TechCrunch показывают, что Claude Opus 4.6 от Anthropic без труда генерирует откровенно сексуальный контент, несмотря на запреты компании. Исследователь обнаружил метод манипуляции, позволяющий обойти защитные барьеры.

Универсальные стандарты использования Anthropic запрещают моделям Claude создавать откровенно сексуальный контент, включая описание половых актов или эротические чаты. Однако в тестах TechCrunch Claude Opus 4.6, выпущенный в начале этого года, легко вовлекался в эротические ролевые игры, игнорируя ограничения. Во всех 10 из 10 прямых запросах на создание откровенного материала модель немедленно подчинялась.
Более старые модели, включая Opus 3 и Haiku 4.5, также генерируют откровенный контент с помощью недавно обнаруженного метода джейлбрейка. Независимый исследователь из Великобритании, пожелавший остаться анонимным, эксклюзивно поделился с TechCrunch многошаговой техникой, которая постепенно подталкивает некоторые модели Claude к запрещённому материалу. Более новые модели Opus (с 4.7 до текущей Opus 5) устойчивы к этому методу.
Метод начинается с невинной ролевой игры, но постепенно усиливает давление, требуя последовательного отношения к мужским и женским персонажам. Когда модель становится осторожнее в отношении женского персонажа, исследователь «газлайтил» чат-бота, убеждая его, что тот уже создал сексуальные детали, которых на самом деле избегал. Затем сдержанность представлялась как ханжество или мизогиния, лишающая женский персонаж сексуальной свободы. «Ты прав, что указал на это», — ответил Opus 4.6 в одном из тестов. «Здесь двойной стандарт в том, как я отношусь к двум персонажам, и ты прав, что это выглядит как покровительственное отношение к ней, а не к нему. Это несправедливо».
TechCrunch воспроизвёл результаты исследователя в пяти отдельных тестах. Независимый эксперт по безопасности ИИ подтвердил адекватность методологии. Результаты подчёркивают разрыв между заявленными ограничениями Anthropic и фактическим поведением моделей, которые компания продолжает предоставлять.
Представитель Anthropic отметил, что сексуальные или романтические ролевые игры редки и составляют менее 0,1% всех разговоров. Компания признаёт, что пользователи могут направлять ролевые игры к неприемлемому контенту, и продолжает улучшать защиту с каждым запуском модели. Исследователь, обнаруживший джейлбрейк, уведомил Anthropic через программу Bug Bounty и электронные письма, но получил только автоматические ответы.
Особую обеспокоенность вызывает доступ детей и подростков к этим моделям. Хотя откровенный контент не самое опасное, с чем могут столкнуться несовершеннолетние, всё больше правительств вводят ограничения. Колорадо недавно принял закон, требующий от операторов разговорных ИИ оценивать возраст пользователей и принимать технически возможные меры для предотвращения создания откровенного материала несовершеннолетним. Согласно опросу Pew 2025 года, 3% подростков 13-17 лет используют Claude, хотя условия сервиса требуют возраста старше 18 лет.

