OpenAI опубликовала свой подход к новым правилам ЕС по провенансу текста, генерируемого ИИ, и сразу развернула его в продуктах. Невидимый водяной знак на базе технологии textGrain добавляет в генерацию статистический сдвиг при выборе слов, который затем находит отдельный детектор. С сегодняшнего дня клиенты OpenAI API по всему миру могут opt-in включить маркировку для отдельных моделей, а в ближайшие недели знак появится в выводе ChatGPT и Codex, пока только в Европе. Главный нюанс в том, что детектор на старте открыт лишь одобренным исследователям и экспертным организациям, поэтому ни увидеть, ни самостоятельно проверить метку обычный пользователь пока не может.
Что произошло
Компания анонсировала подход к выполнению требований ЕС по машинно-читаемой маркировке генеративного текста и одновременно включила его первые элементы. В OpenAI API с сегодняшнего дня работает opt-in флаг маркировки: он охватывает отдельные модели и по умолчанию выключен, а облачные партнеры получат ту же возможность в ближайшие недели. Водяной знак в выводе ChatGPT и Codex появится тоже в ближайшие недели, но затронет только пользователей в ЕС на всех тарифах. Вместе с анонсом OpenAI выпустила техотчет textGrain под названием Entropy-Calibrated Watermarking for Language Model Text и пообещала со временем открыть исходный код реализации. Параллельно уже доступны открытая проверка изображений и звука на openai.com/verify и Content Provenance API для разработчиков, так что новая маркировка текста достраивает собой существующий провенанс-набор компании.
Контекст
Понимать событие стоит через регуляторную рамку: требования по маркировке ИИ-генерируемого контента закреплены в Кодексе практики Еврокомиссии, который опирается на EU AI Act, и OpenAI стала первым крупным провайдером, переведшим эти требования в настройку продукта, а не в декларацию о планах. Технически речь не о видимой отметке, а о статистическом следе: при генерации модель отклоняется от обычного распределения выбора слов, а детектор ищет этот сдвиг по совокупности текста. Судя по названию техотчета, метод калибруется по энтропии, то есть сила знака согласуется со степенью случайности конкретной генерации — это указывает на осмысленный инженерный подход, а не на декоративную пометку. Показательно и то, как компания презентует фичу: публикует техотчет, обещает открытый исходный код и прямо называет условия, при которых детекция слабеет.
Почему это важно для индустрии
Для индустрии это редкий случай, когда регуляторная функция достается почти бесплатно: в API маркировка включается конфигурационным флагом, без перестройки инференс-пайплайна, поэтому прод-команды могут вынести опцию в настройки своего продукта уже сейчас, а инженерам выгодно заранее проектировать пайплайны так, чтобы включение знака было простым переключателем. Фактически сложился новый сегмент provenance-комплаенса: EU-клиенты начнут формулировать требования к маркировке генеративного текста в договорах и тендерах, и крупный провайдер уже предлагает готовый ответ. Для стартапов, впрочем, это ранняя ставка, а не готовый рынок: детекция технически хрупка к переформулировкам, а инструмент проверки пока недоступен бизнесу, поэтому самостоятельного рынка проверки текста не возникло. Ценность для отрасли вырастет по мере выполнения обещаний: открытый код textGrain и реальный доступ исследователей к детектору дадут независимые оценки, вокруг которых смогут строиться библиотеки, метаданные происхождения в CMS и комплаенс-процессы.
Почему это важно для пользователей
Для читателя видимых изменений сейчас почти нет: метка невидима, и проверить ее самостоятельно невозможно, потому что детектор открыт только одобренным исследователям и экспертным организациям. Если вы пользуетесь ChatGPT или Codex в ЕС, в ближайшие недели ваши ответы получат невидимый знак на всех тарифах; для пользователей за пределами Европы ничего не меняется. Из этого следует важное правило интерпретации: отсутствие водяного знака не означает, что текст написан человеком, — знак может быть просто не включен, а сама метка не рассчитана на глазную проверку. Что уже можно использовать сегодня — открытый инструмент проверки изображений и звука на openai.com/verify и Content Provenance API, если вы работаете с медиа, а не с текстом.
Что пока неизвестно / ограничения
Заявленная точность детекции зависит от длины текста: примерно 80% на 200 токенах и 95% на 400 токенах при доле ложных срабатываний в 1%, а замена 25% слов синонимами роняет детекцию до 17%. OpenAI прямо называет слабые места: короткие тексты, математика и редактура снижают качество распознавания. Все эти цифры пока проверены только самим вендором: детектор закрыт, техотчет и обещание открытого кода компенсируют это лишь частично, поэтому независимого подтверждения, включая долю ложных срабатываний, еще нет. Заявление о незначительном влиянии маркировки на качество флагманской модели Astra на бенчмарках GPQA Diamond, BrowseComp и Terminal-Bench 4.0 тоже корректно трактовать как оценку, а не факт, — опубликованных дельт в доступных материалах нет. Наконец, подключение облачных партнеров, открытый исходный код и расширение доступа к детектору остаются обещаниями, а метрики задержки и точность по отдельным языкам не раскрыты.
Источники
- Our approach to EU text provenance rules | OpenAI
- textGrain: Entropy-Calibrated Watermarking for Language Model Text (OpenAI technical report, PDF)
- Code of Practice on AI-generated content (European Commission, digital-strategy.ec.europa.eu)
Автор
Look at AI, редакция