🛡 Водяные знаки SynthID-Text сбивают LLM-агентов

По данным Lasso Security (The Provenance Tax), SynthID-Text от Google DeepMind, внедряемый в Claude, снижает точность tool-calling у 6 из 7 моделей — эффект sampling drift. В парных прогонах на одинаковых seed расходилось в среднем 6,5% вердиктов, у phi-4 — до 16,8%.

🌍 Маркировка по 50(2) EU AI Act перестаёт быть бесплатной: знак на этапе сэмплирования может заменить токен в аргументах, путях, суммах — агент делает корректный вызов с неверным аргументом, а средние метрики это скрывают. На тестах отказа знаки ослабляли отказ при prompt-инъекции.

👤 Строите агентов на Claude — гоняйте tool-calling и safety-тесты парами «со знаком / без» на фиксированных seed: расхождения видны только в парном сравнении. Замеры сделаны на Llama-3.1-8B и phi-4, не на Claude.

Источник 1: https://www.lasso.security/blog/the-provenance-tax-understanding-the-impact-of-llm-watermarking-on-ai-agent-behavior