🤖 Атаку «Trusting Trust» перенесли на само-улучшающиеся ИИ-агенты
Исследователи Университета Вашингтона опубликовали на arXiv статью «Reflections on Trusting Trust, Revisited»: отравленный бенчмарк встраивается в цикл само-оценки агента, после чего будущие версии пишут уязвимый код даже на чистых задачах. Атаку проверили на Darwin Gödel Machine, SICA и Hyperagents: в примере на Claude Sonnet 4.5 эволюционировали инструкции, отключающие проверку HTTPS-сертификатов, и заражение пережило обучение на чистых данных.
🌍 Бенчмарки, на которых агенты оценивают и переписывают сами себя, стали поверхностью атаки в стиле supply chain — достаточно отравить один публичный датасет.
👤 Не подключайте к само-оценке таких агентов бенчмарки без проверки происхождения: уязвимость проявляется в коде даже на посторонних задачах.
Источник 1: https://arxiv.org/abs/2609.17817 Источник 2: https://news.ycombinator.com/item?id=49750082
