🛡 Фундаментальная уязвимость LLM к атакам
Исследователи Жасмин Куи и Чарльз Е представили работу на конференции ICML, доказывающую, что модели не могут надежно разделять системные инструкции и пользовательский ввод. Это позволяет проводить атаки типа Chain-of-Thought Forgery, имитируя системные команды.
🌍 Текущие методы защиты, такие как red-teaming, не решают проблему структурно. Это ставит под сомнение безопасность использования LLM в качестве автономных агентов в критической инфраструктуре и медицине.
👤 Не стоит доверять LLM как «непробиваемым» помощникам. Любые действия, которые ИИ выполняет от вашего имени (агенты), требуют дополнительного контроля.
Источник 1: https://www.technologyreview.com/2026/07/30/1140927/a-fundamental-flaw-leaves-llms-vulnerable-to-attack/
