воскресенье, 27 сентября 2026 г.
Rīga TV

Мировые и латвийские новости в одном месте

ТехнологииОпубликовано: 13 августа 2026 г. в 04:03

Новый шрифт подсовывает ИИ-краулерам бессмысленный текст

Дизайнеры создали шрифт ShieldFont, который показывает людям обычный читаемый текст, а инструментам сбора данных для ИИ — искажённую, бессмысленную версию, чтобы затруднить несанкционированное обучение моделей на веб-контенте.

Foto: Ars Technica

Дизайнеры Исаке Сенеда и Габриэл Абрусио разработали шрифт под названием ShieldFont, который позволяет владельцам сайтов показывать людям один текст, а автоматическим сборщикам данных для искусственного интеллекта — совсем другой, изменённый.

Метод основан на использовании лигатур — функции шрифтов, которая обычно применяется для красивого отображения соседних букв. В ShieldFont лигатуры вместо этого подменяют слова на экране, при этом в исходном HTML-коде остаются другие слова. Человек, просматривающий страницу в браузере, видит нормальный читаемый текст, а сборщик данных, скачивающий сырой HTML, получает искажённую версию.

Как работает замена слов

Вместо замены слов синонимами или антонимами, которые умный краулер мог бы легко распознать и обратить, ShieldFont подменяет слова другими словами с той же грамматической ролью, но совершенно иным значением — например, "лошадь" заменяется на "картофель". В результате предложение выглядит грамматически правильным, но его смысл полностью искажён.

После трёх месяцев доработки создатели составили словарь почти из 12 000 слов, подлежащих замене. Издатели могут выбирать из нескольких вариантов замены для каждого слова, чтобы усложнить обнаружение схемы. В среднем шрифт заменяет около 24,5% всех слов на странице и почти 46% так называемых "смысловых слов".

Результаты тестирования

Протестировав метод на шести общедоступных конвейерах сбора данных, авторы обнаружили, что более 90% страниц, которые обычно проходят фильтры качества краулеров, после применения ShieldFont отклоняются. Среди страниц, которые всё же прошли фильтр, почти пятая часть слов оказалась правильно написанной, но не несущей достоверной информации.

У метода есть и недостатки: изменённый HTML может мешать работе поисковых систем, программ чтения с экрана и переводчиков, а также может быть обойдён краулерами, которые рендерят страницу как изображение и применяют оптическое распознавание символов — хотя это требует значительно больше вычислительных ресурсов. Авторы надеются, что другие разработчики создадут похожие инструменты, чтобы затруднить масштабный сбор данных для ИИ.

Комментарии

0/1500

Комментарии модерируются автоматически. Запрещены ненависть, угрозы, личные данные и спам.

Загрузка комментариев…

Ещё в этой категории

Технологии

iPhone 18 Pro против iPhone 17 Pro: что изменилось на самом деле

Новые iPhone 18 Pro и 18 Pro Max от Apple получили улучшенную камеру, более быстрый процессор и увеличенное время автономной работы, однако в целом изменения остаются умеренными по сравнению с прошлогодними моделями. Владельцам iPhone 17 Pro спешить с обновлением не обязательно.

Engadget · 36 мин назад

Технологии

Немецкие муниципалитеты рассматривают ИИ-технологии латвийской компании Tilde

Правительство земли Мекленбург-Передняя Померания на северо-востоке Германии изучает возможность пилотного проекта по внедрению платформы искусственного интеллекта латвийской компании Tilde в госуправлении. Переговоры ведутся и с другими немецкими муниципалитетами, ищущими безопасные решения для управления данными.

LSM · 39 мин назад

Технологии

Почему в Китае скептически относятся к западным предупреждениям о рисках ИИ

The New York Times сообщает, что в Китае предупреждения о экзистенциальных рисках искусственного интеллекта воспринимают с недоверием — как чисто западную идею или как попытку затормозить китайские ИИ-компании, догоняющие американских конкурентов.

The New York Times · 40 мин назад