Anthropic начала маркировать текст, созданный Claude, для соответствия правилам ЕС
Anthropic рассказала, как незаметно маркирует текст, сгенерированный её ИИ Claude, чтобы выполнить новые требования Евросоюза о прозрачности искусственного интеллекта. Метод основан на скрытой закономерности выбора слов, которую можно расшифровать только с помощью специального ключа.

Компания Anthropic раскрыла детали системы маркировки текста, создаваемого её ИИ-моделью Claude, введённой для соблюдения новых правил Евросоюза о прозрачности систем искусственного интеллекта. По словам компании, такая метка не имеет видимых признаков, незаметна для читателей и не добавляет в текст скрытых символов.
Как это работает
Большие языковые модели генерируют текст, выбирая каждое слово из списка подходящих по контексту вариантов, обычно случайным образом. При включённой маркировке Claude вместо генератора случайных чисел использует специальный ключ для выбора слов. В качестве примера Anthropic показала схему, где ключом служат цифры числа пи: каждая цифра определяет, какой по порядку вариант слова из списка выберет модель. Подход адаптирован из технологии SynthID-Text компании Google DeepMind, описанной в статье, опубликованной в журнале Nature.
Anthropic утверждает, что маркировка не влияет на качество текста, не замедляет генерацию и не требует дополнительных вычислительных ресурсов. Компания планирует выпустить API, который с помощью соответствующих ключей позволит проверить, был ли конкретный текст создан Claude.
Ограничения
У метода есть существенные недостатки. Он не может определить, написал ли Claude текст самостоятельно или лишь отредактировал его, — отредактированный и переведённый текст получит ту же метку. Если текст короткий или Claude лишь слегка его вычитал, метка может оказаться недостаточно устойчивой для обнаружения. Небольшие правки вряд ли уберут маркировку — для надёжного удаления текст нужно переписать полностью.
Что касается программного кода, Anthropic отмечает, что маркировка в нём обычно выражена слабее, поскольку генерация кода часто требует точного, заранее определённого результата с минимальным выбором вариантов слов. Компания также будет маркировать изображения, созданные Claude, добавляя криптографически подписанную отметку в их метаданные.
Новая система распspace действует на весь вывод Claude во всех регионах для моделей, выпущенных после 2 августа, поскольку у Anthropic пока нет надёжного способа ограничить функцию по регионам. Возможность маркировки для более старых моделей Claude появится в течение ближайших месяцев.


