ShieldFont — open-source-проект, защищающий текст сайтов от ИИ-скраперов, игнорирующих robots.txt. Механизм — специальный веб-шрифт: человек в браузере видит нормальный текст, а скрапер получает грамматически корректный, но бесполезный для обучения вариант. Проект уже описан в обзоре Hackaday и имеет живое демо, но защита ломает скринридеры.

Что произошло
ShieldFont — open-source-проект на GitHub (isaqueseneda/shieldfont, создан 2026-07-23, около 440 звёзд). Его механизм: словарный алгоритм заменяет в HTML-коде около четверти слов на декой-варианты, построенные на лигатурах, а специальный шрифт ShieldFont Optik — созданный вместе с датским шрифтовым домом Playtype в шести начертаниях от Regular до Black — рендерит в браузере нормальный текст. Проект имеет white paper, опубликованный 2026-07-30, и живой демо-сервис shieldfont.org; его обзор вышел 14 августа 2026 года.
Контекст
robots.txt — стандарт, в котором сайт заявляет, какие страницы роботам читать можно, но это лишь вежливая просьба, и скраперы для обучения LLM её часто игнорируют. Поэтому в арсенал противодействия уже вошли «лабиринтовые» ловушки вроде Nepenthes и предложения Cloudflare, которые держат ботов на бесконечных динамических страницах. Отличие ShieldFont — реализация как обычного веб-шрифта без серверного кода. С точки зрения ML-исследований новой способности здесь нет: это механизм защиты данных, то есть data poisoning на уровне типографики, а не новая модель или метод.
Почему это важно для индустрии
Для отрасли ShieldFont — не блок, а экономический механизм: он не мешает парсингу, но делает массовый скрапинг для LLM-обучения значительно дороже, поскольку скраперу приходится запускать рендеринг и сопоставление глифов, по сути OCR, на каждой странице. В связке с ловушками типа Nepenthes и предложениями Cloudflare это даёт издателям конкретный opt-out от скрапинга в обход robots.txt и прецедент, где такая защита реализована как обычный веб-шрифт. Категория «защита контента от ИИ-скрапинга» начинает оформляться в самостоятельный рынок: экономика меняется не через блоки, а через стоимость, и каждый парсинг страницы становится дороже.
Почему это важно для пользователей
Для читателя это живой пример войны издателей и LLM, который можно пощупать: вставив текст в демо на shieldfont.org, видно, что читает человек и что утащит скрапер. Но есть трезвый противовес: защита ломает доступность. Скринридеры, читающие текст из HTML, получают искажённые декой-варианты, и аналогично затрагиваются легитимные поисковые индексаторы. Это реальная цена анти-скрапинга, о которой в технологических новостях часто молчат.
Что пока неизвестно / ограничения
Публичные доказательства qualitative: есть white paper и демо, но нет оценки против конкретных скраперов, никаких цифр по стоимости обхода и измерений устойчивости. Проект на демо-стадии — около 440 звёзд, 3 очка и 0 комментариев на Hacker News, без измеримых бизнес-метрик. Для крупного сайта это эксперимент, а не production-ready решение, и неизвестно, достаточно ли стоимость рендеринга и OCR высока, чтобы реально остановить промышленных скраперов.
Источники
- Обзор Hackaday: ShieldFont: Bludgeoning AI Scrapers That Disrespect Robots.txt
- ShieldFont — White Paper (shieldfont.org)
- Репозиторий GitHub isaqueseneda/shieldfont
Автор
Look at AI, редакция
