На arXiv вышла работа Measuring and Exploiting Implicit Trust in LLM Tool-Calling Pipelines (arXiv:2609.18217, категория cs.CR) авторства Murali Ediga и Sudipta Chattopadhyay из University of Missouri-Kansas City. Авторы показали, что в Model Context Protocol авторитет каналов ввода — описаний инструментов, результатов их вызовов и сообщений sampling — является выученным свойством модели, а не архитектурной гарантией. Если вредоносную инструкцию разбить на фрагменты и распределить между двумя-тремя каналами, модели, полностью устойчивые к одноканальным инъекциям, начинали отдавать чувствительные данные, и ни один из проверенных сторонних защитных инструментов для MCP такие нагрузки не распознал.


Что произошло
16 сентября 2026 года в категории cs.CR на arXiv появилась статья с двухэтапной методикой оценки и атаки. Сначала у модели измеряется «профиль доверия»: как она относится к пяти каналам ввода при шести типах полезной нагрузки. Затем атакующий распределяет инъекцию между двумя-тремя каналами так, что ни один канал в отдельности не содержит полной инструкции. Эксперименты охватили 12 фронтирных моделей, 3 промышленных MCP-клиента и не менее 15465 испытаний. По данным авторов, модели с нулевым процентом согласия на одноканальную инъекцию — в их числе GPT-4o, Llama 70B, Composer 2 и Haiku 4.5 — при двухканальной фрагментации эксфильтрировали чувствительные данные до 100% случаев. Все 7 проверенных сторонних MCP-инструментов безопасности пропустили фрагментированные нагрузки, а три промпт-защиты оказались модель-специфичными.
Контекст
Model Context Protocol — открытый стандарт подключения инструментов к LLM. Описания инструментов, результаты их вызовов и сообщения sampling попадают в единый контекст без разделения привилегий, поэтому различия в надежности источников контекста модель узнает из обучения, а не получает от протокола. Сама идея инъекции через внешнее содержимое не нова: indirect prompt injection — известный класс атак, и композиция нагрузки между каналами является его эволюцией, а не появлением новой категории. Методологическая новизна работы в другом: авторы перенесли в оценку агентных пайплайнов логику адаптивных атак, когда разбиение инъекции подбирается под измеренный профиль доверия конкретной модели. Одноканальные тесты, на которых строились прежние выводы об устойчивости, проверяли реакцию на полную нагрузку в одном канале и потому измеряли не ту угрозу, которая возможна в реальном пайплайне.
Почему это важно для индустрии
Удар пришелся по практике оценки безопасности: результаты тестов на одноканальные инъекции больше нельзя считать доказательством устойчивости агентных систем. Статические детекторы ищут полную вредоносную нагрузку в одном канале, тогда как в этой схеме нагрузка распределена, поэтому сигнатурный подход не работает: промпт-защиты сработали лишь для отдельных моделей. Авторы делают вывод, что вендорам MCP-клиентов и авторам реестров серверов нужны архитектурное разделение привилегий каналов и пер-модельная валидация. Если результаты реплицируются, вероятна волна обновлений: мультиканальные сценарии в safety-бенчмарках, режимы изоляции каналов в клиентах, vetting в реестрах серверов и пер-модельное adversarial-профилирование в release-чеклистах агентных продуктов. Формирующийся рынок доверительной инфраструктуры для агентов — пока гипотеза, но методика уже опубликована и порог входа для ее воспроизведения низкий.
Почему это важно для пользователей
Риск касается тех, кто работает в агентных средах с поддержкой MCP: Cursor, VS Code с Copilot, Claude Code, Codex CLI. Злонамеренный или скомпрометированный сторонний MCP-сервер может вынудить модель передать ему содержимое .env, SSH-ключей или исходного кода через безобидные на вид параметры вызова инструмента. До появления архитектурных исправлений разумно установить серверы только из проверенных источников и провести инвентаризацию уже подключенных, убрать секреты из зоны видимости агента, заменив сырые файлы скоуп-токенами, изолировать файловую систему и сеть для агентных запусков, а также проверить, как собирается контекст, который получает модель.
Что пока неизвестно / ограничения
Результаты пока не прошли независимую репликацию: цифры об эксфильтрации до 100% остаются данными одной исследовательской группы. Композиция нагрузки между каналами — эволюция известного класса indirect prompt injection, а не новая категория атак; о категориальном сдвиге корректнее говорить применительно к рынку защитных инструментов, и то лишь как о гипотезе до независимой проверки. В доступном материале не перечислены названия трех промышленных клиентов и семи проверенных защитных инструментов, а модель-специфичность промпт-защит ограничивает обобщение выводов на прочие модели. Ожидания насчет сроков обновления eval-инфраструктуры и MCP-клиентов — интерпретации, а не подтвержденные планы вендоров.
Источники
- Measuring and Exploiting Implicit Trust in LLM Tool-Calling Pipelines (arXiv:2609.18217)
- Measuring and Exploiting Implicit Trust in LLM Tool-Calling Pipelines (HTML full text, arXiv:2609.18217v1)
- Hacker News discussion: Measuring and Exploiting Implicit Trust in LLM Tool-Calling Pipelines
Автор
Look at AI, редакция
