Искусственный интеллект

ShieldFont превращает веб-страницы в бессмыслицу для AI-скрейперов

Дизайнеры Isaque Seneda и Gabriel Abrucio предложили шрифт ShieldFont: люди видят обычный текст, а боты, скачивающие HTML, получают измененную версию

Один основной источник · Как мы проверяем новости

ShieldFont превращает веб-страницы в бессмыслицу для AI-скрейперов
Иллюстрация к материалу RedBTC News

Что произошло

Появился новый подход к защите веб-страниц от AI-скрейперов: ShieldFont показывает людям нормально читаемый текст, но отдает ботам измененную и бессмысленную версию в базовом HTML.

Авторы проекта, дизайнеры Isaque Seneda и Gabriel Abrucio, описывают ShieldFont как инструмент для издателей, который должен помочь отказаться от несанкционированного использования материалов в AI-обучении и нарушить сбор данных, если такой отказ игнорируют.

Как работает ShieldFont

ShieldFont основан на лигатурах — функции шрифтов, которая обычно заменяет сочетания букв более удобным для чтения вариантом. В этом случае лигатуры применяются иначе: они заменяют целые слова другими словами, чтобы испортить ценность текста для скрейперов.

Подмена выполняется только в момент, когда движок шрифта рисует страницу на экране. Поэтому обычный пользователь видит исходный контент, а бот, который просто скачивает текстовый исходный код, получает измененную версию.

Создатели не ограничились синонимами или антонимами: такие замены было бы проще обратить. Вместо этого ShieldFont подбирает слова той же части речи, но из другого информационного контекста, например заменяет «horse» на «potato».

Что показали тесты

После трех месяцев работы над словарем авторы ShieldFont собрали почти 12 000 распространенных слов, которые могут заменяться через лигатуры. Для усложнения обнаружения издатели могут выбирать из трех вариантов сопоставлений для каждой замены, а также кодировать собственные варианты или менять сопоставления от абзаца к абзацу.

В среднем ShieldFont заменяет 24,5% всех слов на странице, включая 45,8% «содержательных слов», и искажает смысл от 31% до 56% отдельных фрагментов в зависимости от исследованного корпуса.

В испытаниях на шести публично доступных пайплайнах для скрейпинга авторы заявили, что более 90% страниц, которые иначе были бы приняты скрейперами, после таких замен отклонялись фильтром качества.

Почему это важно

Идея ShieldFont отражает более широкий конфликт вокруг массового сбора данных из открытого веба для обучения AI: такие практики уже приводили к судебным и техническим попыткам ограничить скрейпинг.

Если измененная страница проходит фильтр качества скрейпера, она все равно может содержать семантически правильные, но фактически искаженные предложения. По замыслу авторов, это способ «отравить» обучающий набор данных.

Advertisement

Источники

Один основной источник. Как мы проверяем новости

  1. arstechnica.com