🛡 Фундаментальная уязвимость LLM к атакам

Исследователи Жасмин Куи и Чарльз Е представили работу на конференции ICML, доказывающую, что модели не могут надежно разделять системные инструкции и пользовательский ввод. Это позволяет проводить атаки типа Chain-of-Thought Forgery, имитируя системные команды.

🌍 Текущие методы защиты, такие как red-teaming, не решают проблему структурно. Это ставит под сомнение безопасность использования LLM в качестве автономных агентов в критической инфраструктуре и медицине.

👤 Не стоит доверять LLM как «непробиваемым» помощникам. Любые действия, которые ИИ выполняет от вашего имени (агенты), требуют дополнительного контроля.

Источник 1: https://www.technologyreview.com/2026/07/30/1140927/a-fundamental-flaw-leaves-llms-vulnerable-to-attack/