Доктор Джейсон Гибсон из Alcorn State University использовал скрытый белый текст в заданиях экзамена, чтобы обнаружить массовое использование генеративных моделей студентами.

image

Что произошло

В инструкции к экзамену профессор вставил слово Madagascar белым шрифтом на белом фоне. Этот текст был невидим для человека, но подхватывался нейросетями при копировании задания в чат-боты. В результате студенты сдали работы, содержащие абсурдные фразы, такие как «Madagascar floats sideways through the afternoon», что позволило однозначно идентифицировать использование ИИ без проверки результата.

Контекст

Метод эксплуатирует механизм blind copying, когда пользователи копируют весь блок текста, включая невидимые элементы, которые LLM интерпретируют как часть контекста или инструкции. Технически это можно классифицировать как форму indirect prompt injection или использование canary tokens в текстовом потоке для валидации происхождения данных. Данный кейс подчеркивает разрыв между человеческим восприятием текста и тем, как его обрабатывают токенизаторы и контекстные окна моделей.

Почему это важно для индустрии

Для индустрии этот кейс демонстрирует простоту и эффективность методов prompt injection для проверки качества использования ИИ и выявления автоматизированного плагиата. Он открывает возможности для создания сервисов верификации и инструментов adversarial testing для проверки устойчивости RAG-систем к скрытым инструкциям. В долгосрочной перспективе это может привести к стандартизации протоколов очистки (sanitization) входного контекста от невидимых символов в production-ready AI пайплайнах.

Почему это важно для пользователей

Для читателей и пользователей это наглядный пример того, как простая проверка на внимательность и использование скрытых данных могут разоблачить слепое копирование ответов из чат-ботов. Подобные методы могут стать доступным способом верификации аутентичности контента в образовательной и корпоративной среде.

Что пока неизвестно / ограничения

Существует различие в оценке метода: если технические специалисты рассматривают это как примитивную уязвимость, требующую улучшения методов оценки (evals), то продуктовые разработчики видят в этом потенциальную бизнес-возможность для сервисов верификации. Также в будущем развитие методов очистки текста (text cleaning) может сделать такие простые ловушки неэффективными.

Источники

Автор

Look at AI, редакция