Новый шрифт подсовывает ИИ-краулерам бессмысленный текст
Дизайнеры создали шрифт ShieldFont, который показывает людям обычный читаемый текст, а инструментам сбора данных для ИИ — искажённую, бессмысленную версию, чтобы затруднить несанкционированное обучение моделей на веб-контенте.

Дизайнеры Исаке Сенеда и Габриэл Абрусио разработали шрифт под названием ShieldFont, который позволяет владельцам сайтов показывать людям один текст, а автоматическим сборщикам данных для искусственного интеллекта — совсем другой, изменённый.
Метод основан на использовании лигатур — функции шрифтов, которая обычно применяется для красивого отображения соседних букв. В ShieldFont лигатуры вместо этого подменяют слова на экране, при этом в исходном HTML-коде остаются другие слова. Человек, просматривающий страницу в браузере, видит нормальный читаемый текст, а сборщик данных, скачивающий сырой HTML, получает искажённую версию.
Как работает замена слов
Вместо замены слов синонимами или антонимами, которые умный краулер мог бы легко распознать и обратить, ShieldFont подменяет слова другими словами с той же грамматической ролью, но совершенно иным значением — например, "лошадь" заменяется на "картофель". В результате предложение выглядит грамматически правильным, но его смысл полностью искажён.
После трёх месяцев доработки создатели составили словарь почти из 12 000 слов, подлежащих замене. Издатели могут выбирать из нескольких вариантов замены для каждого слова, чтобы усложнить обнаружение схемы. В среднем шрифт заменяет около 24,5% всех слов на странице и почти 46% так называемых "смысловых слов".
Результаты тестирования
Протестировав метод на шести общедоступных конвейерах сбора данных, авторы обнаружили, что более 90% страниц, которые обычно проходят фильтры качества краулеров, после применения ShieldFont отклоняются. Среди страниц, которые всё же прошли фильтр, почти пятая часть слов оказалась правильно написанной, но не несущей достоверной информации.
У метода есть и недостатки: изменённый HTML может мешать работе поисковых систем, программ чтения с экрана и переводчиков, а также может быть обойдён краулерами, которые рендерят страницу как изображение и применяют оптическое распознавание символов — хотя это требует значительно больше вычислительных ресурсов. Авторы надеются, что другие разработчики создадут похожие инструменты, чтобы затруднить масштабный сбор данных для ИИ.


