Программисты заявляют, что уже нашли способы обойти невидимые водяные знаки Claude
Через несколько часов после того, как Anthropic объявила о внедрении невидимых водяных знаков в тексты, созданные Claude, разработчики опубликовали инструменты для их удаления. Код быстро стал вирусным, что ставит под сомнение надёжность нового требования ЕС о маркировке.

На прошлой неделе компания Anthropic сообщила, что модели Claude по всему миру начнут встраивать в сгенерированный текст невидимые, машиночитаемые водяные знаки, чтобы соответствовать требованиям закона ЕС об искусственном интеллекте. Всего через четыре часа разработчик Гийом Мейер опубликовал код, позволяющий удалять эти метки. С тех пор его инструмент собрал более 20 000 закладок в X и привлёк свыше 100 участников на GitHub.
Правила ЕС, вступившие в силу в начале этого месяца, обязывают таких поставщиков, как Anthropic и OpenAI, маркировать синтетические аудио, изображения, видео и текст так, чтобы их мог распознать автомат, — под угрозой штрафа до 3% годового оборота. При этом самим компаниям запрещено продвигать средства обхода маркировки, однако независимые разработки под этот запрет не подпадают.
По словам Мейера, часть людей пытается обойти маркировку из принципиального несогласия с идеей обязательной пометки любого ИИ-контента, тогда как другие, включая его самого, делают это ради технического интереса. Он говорит, что поддерживает прозрачность происхождения контента, но считает водяные знаки неудачным решением из-за риска ложных срабатываний и неспособности отличить лёгкое редактирование от активного использования ИИ — это, по его мнению, может привести к несправедливому отказу кандидатам при трудоустройстве или необоснованным обвинениям исследователей.
Anthropic использует технологию SynthID, разработанную Google: она незаметно влияет на выбор слов и фраз Claude, не меняя смысла или качества текста, утверждает компания. Метод Мейера использует другие языковые модели, не встраивающие водяные знаки, для переписывания текста, однако это может усложниться, поскольку 190 организаций, включая OpenAI, Microsoft и Meta, подписали кодекс прозрачности ЕС.
Другие разработчики, включая инженера Эрика Хьюза и приглашённого научного сотрудника Оксфорда Леона Клона, создали собственные обходные методы — удаление символов, перестановку предложений, замену синонимов или перевод текста на другой язык и обратно. Anthropic признала, что сильно отредактированный, перефразированный или переведённый текст может не сохранить обнаруживаемый водяной знак. Компания планирует выпустить инструмент для проверки подлинности меток, который позволит наконец протестировать эффективность существующих методов их удаления.


