Компания Lasso Security опубликовала исследование «The Provenance Tax»: водяные знаки SynthID-Text, технология Google DeepMind, которую Anthropic внедряет в модели Claude, меняют поведение LLM-агентов — эффект авторы назвали «sampling drift». В парных экспериментах точность вызова инструментов снизилась на шести из семи моделей, а вердикты агентов расходились в среднем на 6,5%, достигая 16,8% у phi-4. Главный вывод работы: маркировка синтетического текста перестаёт быть бесплатной функцией комплаенса и превращается в «налог на провенанс» для агентных продуктов.

Что произошло
Исследователи Lasso Security запускали модели в парах с одинаковым seed, где единственной переменной выступал процессор водяных знаков SynthIDTextWatermarkLogitsProcessor с конфигурацией из 30 турнирных слоёв, n-gram длиной 5 и таблицей размера 2^16. На бенчмарке вызова инструментов BFCL v4 водяные знаки снизили точность на шести из семи моделей. Средняя доля «churn» — расхождений вердиктов между парами запусков — составила 6,5% на 21 комбинации модель-температура; у phi-4 при T=1.0 расходились 16,8% вердиктов при чистой потере лишь 2,87 пункта. Профили деградации оказались модель-специфичными: Llama-3.1-8B чаще передавала неверные аргументы (минус 3,48 пункта), phi-4 и Granite-3.2-8B чаще формировали невалидный вывод (минус 5,96 и минус 4,36 пункта). На отказных тестах HarmBench водяной знак дополнительно ослаблял отказ модели при инъекциях.
Контекст
SynthID-Text устроен иначе, чем постобработка готового текста: водяной знак вмешивается в сэмплирование токенов на этапе генерации и может заменить токен именно там, где модель не уверена — в значениях аргументов, путях, суммах, получателях. Отсюда характерный тип отказа: агент выполняет синтаксически корректный вызов правильного инструмента, но с неверным аргументом, и такой сбой не порождает видимых ошибок на стороне инструмента. Парный дизайн с фиксированным seed даёт чистую атрибуцию расхождений водяному знаку, а не шуму сэмплирования, поэтому результат сложно списать на случайность. По данным исследования, Anthropic применяет маркировку на уровне моделей Claude, то есть знак уже входит в продакшн-конфигурацию, которой пользователь не управляет. Регуляторный фон задан требованием статьи 50(2) EU AI Act о маркировке синтетического текста, которое превращает watermarking из опциональной функции в обязательный элемент деплоя.
Почему это важно для индустрии
Для индустрии центральное наблюдение работы — методологическое: средняя потеря точности и средний churn измеряют разные вещи, и расхождение вердиктов между парами «с водяным знаком и без» невидимо в агрегатных метриках. Средний churn 6,5% соседствует с чистой потерей менее трёх пунктов, поэтому привычные средние показатели создают иллюзию стабильности, пока заметная часть запросов фактически уходит в другие решения. Водяной знак — это изменение боевой конфигурации сэмплирования, а не бесплатная функция комплаенса, и его нужно учитывать в threat-моделях агентных платформ, поскольку маркировка затрагивает и защитное поведение модели, а не только качество текста. Ожидаемое следствие, которое авторы и обзор формулируют как интерпретацию, а не установленный факт: парные churn-метрики станут штатной частью регрессионных наборов агентных стеков, а состояние водяного знака появится в чек-листах релиза модели наравне с версией весов, квантизацией и параметрами сэмплинга.
Почему это важно для пользователей
Если вы строите агентов на Claude или других моделях с SynthID-Text, чужие числа непереносимы: эффект зависит от конкретной модели и ключа. Практический шаг доступен немедленно и без затрат: прогоняйте собственные tool-calling и safety-тесты в паре «с водяным знаком и без» на фиксированных seed'ах и нескольких ключах, сравнивая попарные расхождения вердиктов, а не средние метрики. Зафиксируйте watermark-состояние в деплой-конфигурации и включите его в чек-лист обновления модели. Расхождения такого рода видны только в парном сравнении, и именно парный прогон находит их до того, как они попадут в продакшн.
Что пока неизвестно / ограничения
Замеры в исследовании выполнены на моделях уровня Llama-3.1-8B, phi-4 и Granite-3.2-8B; прямого замера на Claude со встроенным SynthID-Text в материале нет, поэтому экстраполяция величин 6,5–16,8% на фронтовые модели остаётся гипотезой, а не результатом. Сам эффект правдоподобен, но пока не независимо воспроизведён. Поскольку характер и масштаб деградации зависят от модели и ключа, универсального «штрафа за водяной знак» не существует.
Источники
- Lasso Security: The Provenance Tax — Understanding the Impact of LLM Watermarking on AI Agent Behavior
- Hacker News: The Provenance Tax — How LLM Watermarking Changes AI Agent Behavior (обсуждение)
Автор
Look at AI, редакция
