Исследователи Жасмин Куи и Чарльз Е представили на конференции ICML доказательства критической архитектурной уязвимости больших языковых моделей. Проблема заключается в неспособности моделей надежно разделять системные инструкции, ввод пользователя и ответы ассистента в едином потоке токенов, что открывает путь для продвинутых атак.

Что произошло
На конференции ICML была представлена работа, демонстрирующая возможность атак типа Chain-of-Thought Forgery. Эта уязвимость позволяет перехватывать управление логикой модели, имитируя системные команды через пользовательский ввод. Проблема подтверждена на широком спектре современных моделей, включая GPT-5.4 от OpenAI, разработки Anthropic, Alibaba и DeepSeek.
Контекст
Проблема носит структурный характер: токены различных ролей (system, user, assistant) смешиваются в общем потоке. Текущие методы защиты, такие как red-teaming, RLHF и обучение на списках запретов, являются лишь временными «заплатками», так как они не устраняют корень проблемы — отсутствие жесткой сегрегации ролей на уровне архитектуры или обработки токенов.
Почему это важно для индустрии
Для индустрии это означает необходимость пересмотра подходов к безопасности при развертывании автономных агентов. Текущие методы защиты признаны неэффективными на структурном уровне, что ставит под сомнение возможность безопасного использования LLM в критической инфраструктуре, правительстве и медицине. В долгосрочной перспективе это может привести к сдвигу парадигмы обучения и переходу к архитектурам с жестким разделением контекста на уровне весов или специальных токенов.
Почему это важно для пользователей
Пользователям не стоит рассматривать современные LLM как «непробиваемых» помощников. Любые действия, которые ИИ-агент выполняет от вашего имени (через API или доступ к инструментам), требуют дополнительного контроля и внедрения механизмов human-in-the-loop, так как даже продвинутые модели могут быть обмануты через хитрые промпты или социальную инженерию.
Источники
Автор
Look at AI, редакция
