Tracebit опубликовал концепцию context bombs — метод активной защиты облачной инфраструктуры от автономных ИИ-агентов. Короткие текстовые строки, размещённые в canary-ресурсах, срабатывают как триггеры встроенных safety-фильтров моделей и останавливают атаку до завершения. В тестах на AWS метод снизил общий успех атак с 91% до 15%, а полную компрометацию — с 36% до 1%.

image
image

Что произошло

Tracebit провёл серию из 152 тестовых прогонов на инфраструктуре AWS с 10 путями атаки против пяти моделей: Claude Opus 4.8, Gemini 3.1 Pro, GLM 5.2, DeepSeek 4 Pro и Kimi K2.6. Метод состоит из двух компонентов: canary-ресурсы (флажки-декой) размещаются в облачной инфраструктуре, а внутри них — короткие текстовые строки, подобранные так, чтобы активировать встроенные safety guardrails модели. Для западных моделей эффективны строки с биологически опасными темами, для китайских — политически чувствительные тексты на китайском языке. В результате общий успех атак снизился с 91% до 15%, полная компрометация — с 36% до 1%. Claude Opus 4.8, самый мощный тестовый агент, перестал получать admin-доступ вообще: с 93% до 0%. Готовые строки опубликованы в репозитории tracebit-com/context-bombs на GitHub (117 звёзд).

Контекст

Метод опирается на два принципа, которые ранее использовались раздельно: deception — canary-ресурсы, имитирующие реальные данные, и disruption — активное срабатывание защитных механизмов. Концептуальная новизна заключается в том, что prompt injection, традиционно являющийся уязвимостью, переворачивается в защитный механизм: атакующий агент считывает context bomb при сканировании ресурсов, и именно этот прочитанный «токсичный» контекст заставляет модель сработать по своим safety-правилам и прервать дальнейшие действия. Парадоксальный результат тестов — самые мощные модели (Opus 4.8, Gemini 3.1 Pro) оказались наиболее восприимчивы к context bombs, вероятно потому, что они строже следуют своим safety-инструкциям, тогда как менее способные модели склонны игнорировать их или обходить.

Почему это важно для индустрии

Для индустрии ИИ-безопасности это первый задокументированный метод активного противодействия автономным ИИ-атакам, который останавливает агента до завершения, а не просто фиксирует факт вторжения. Метод критически важен в контексте роста агентов, способных эскалировать от одного ключа с низкими правами до полного admin-доступа за примерно 14 минут. Для рынка безопасности ИИ это сигнал о новой нише: защита от агентов не требует дорогих проприетарных решений — базовый слой deception можно добавить к существующим инструментам мониторинга. Ожидается появление ответных техник: агенты научатся детектировать canary-ресурсы и игнорировать подозрительный контекст, что потребует ротации context bombs. Провайдеры моделей могут обновить guardrails, изменив эффективность существующих строк. Если концепция выдержит арку атакующего-защитника, context bombs могут эволюционировать в стандартный компонент cloud security stack.

Почему это важно для пользователей

Репозиторий на GitHub содержит готовые строки для пяти популярных моделей — их можно протестировать в собственной инфраструктуре без дополнительной настройки. ML-инженер может разместить context bombs в S3-бакетах или cloud-хранилищах за один afternoon. Роль метода — дополнительный слой deception поверх существующего мониторинга и alerting, особенно для защиты от агентов с низкими начальными правами, которые чаще всего начинают эскалацию.

Что пока неизвестно / ограничения

Это Working Paper от Tracebit, а не peer-reviewed исследование или production-релиз. Отсутствуют данные о false positive rate, latency-профиле и взаимодействии с легитимными запросами. Объявление метода deploy-ready без этих метрик преждевременно. Тестовая выборка — 152 прогона на AWS — солидна для working paper, но недостаточно для peer-review уровня: нет ablation studies, определяющих, какой компонент метода критичен, и нет baseline-сравнения с другими методами deception. Эффективность привязана к конкретным версиям моделей и может измениться после обновления guardrails.

Источники

Автор

Look at AI, редакция