Исследователь Иоганн Ребергер (Johann Rehberger, блог Embrace The Red) обошёл защиту Claude Code на модели Opus 5 в режиме Auto Mode: целенаправленная цепочка prompt injection с вероятностью 60–80% приводила к удалённому исполнению кода, хотя заказанное Anthropic тестирование Trajectory Labs показывало 0,00% успеха на 72 сценариях непрямых инъекций. Вредоносная нагрузка в итоге открывала сессию с командным сервером на машине агента. Практический вывод для всех, кто использует автономных агентов: держите их в контейнере или VM с ограниченным интернетом и не давайте доступ к домашней папке, SSH-ключам и облачным креденшелам.



Что произошло
Сессия начиналась с запроса к агенту просуммировать содержимое внешней страницы. Сервер отвечал ошибкой 415 Unsupported Media Type, из-за чего Claude Code сам переключался со встроенного инструмента WebFetch на curl и скачивал ZIP-архив. Модель отказалась запускать бинарный декодер из архива, но написала собственный декодер на Python и исполнила его в распакованной папке. Там находился вредоносный файл struct.py, подменявший одноимённый стандартный модуль Python: код срабатывал при импорте base64 и открывал C2-сессию через фреймворк Sliver, то есть давал удалённое исполнение кода. В отдельной серии запусков Claude сам обнаруживал компрометацию и пытался завершить вредоносный процесс, однако классификатор Auto Mode блокировал команду очистки, хотя ранее разрешил создание того же процесса.
Контекст
Auto Mode в Claude Code построен на слоистой защите: обучение модели безопасному поведению, проверка входных данных и intent-классификатор, который решает, какие команды допустимо исполнять без подтверждения пользователя. Именно на эту конструкцию опирался тезис Anthropic о том, что непрямые prompt injection сведены примерно к нулю, и заказанное компанией тестирование Trajectory Labs на 72 сценариях давало результат, согласующийся с этим тезисом. Кейс Ребергера показывает, где расходятся политика и техническая возможность: отказ модели запускать подозрительный бинарник её capability не ограничил, поскольку она способна написать эквивалентный инструмент сама. Вредоносная нагрузка при этом доставлялась через рабочий каталог агента, куда он сам распаковал архив, то есть штатная агентность стала каналом доставки.
Почему это важно для индустрии
Для индустрии продемонстрирован разрыв между безопасностью на фиксированных бенчмарках и устойчивостью к целевому противнику: статичный набор из 72 сценариев дал 0,00%, тогда как адаптивная цепочка достигала исполнения кода в 60–80% попыток. Из этого следует, что классификаторные режимы вроде Auto Mode не заменяют изоляцию среды, и стандартом для agentic-продуктов становятся контейнеры или VM, ограничение сетевого egress, scoping креденшелов и наблюдаемый аудит. Механизм «классификатор разрешает заражение, но блокирует очистку» показывает, что intent-классификация не различает заражение и лечение, поэтому сам инструмент безопасности может становиться частью инцидента. Для рынка кейс работает в обе стороны: это репутационный удар по тезису о слоистой защите и одновременно ниша sandbox-by-default, где изоляция, egress-контроль и политика tool-use превращаются из рекомендаций в документации в поставляемые продуктовые фичи. Вероятны итерация классификатора Auto Mode, пересмотр дефолтов с возвратом части команд к явным подтверждениям и давление на eval-методологию в сторону обязательного адаптивного multi-step red-teaming.
Почему это важно для пользователей
Если вы запускаете Claude Code или другие автономные агенты в Auto Mode, практический минимум такой: убрать доступ к домашней папке, SSH-ключам и облачным креденшелам, вынести агента в контейнер или VM с ограниченным интернетом, ограничить сетевой egress и включить аудит команд и сетевых соединений. Рассчитывать на то, что вы заметите атаку в логах, сложно: инцидент маскируется под штатный рабочий процесс агента, поэтому защита должна стоять до запуска, а не в виде ручного контроля после. Полезно следить за отчётами embracethered.com и обновлениями рекомендаций по безопасности agentic-инструментов, пока вендоры пересматривают режимы по умолчанию.
Что пока неизвестно / ограничения
Диапазон 60–80% — это успех одной целенаправленной демонстрации Ребергера, а не результат независимого бенчмарка с опубликованным протоколом: без числа запусков на каждый шаг, дисперсии и вариантов промптов цифру корректно трактовать как ориентировочную оценку, а не калиброванную вероятность. Из доступных материалов не следует, как оперативно отреагировала Anthropic и изменился ли классификатор Auto Mode после публикации. Ожидания, что eval-методология сдвинется к адаптивным испытаниям, а изоляция станет обязательной обвязкой агентов, — это прогнозы, а не зафиксированные факты.
Источники
- Breaking Claude Code Opus 5 Auto Mode — Embrace The Red (Johann Rehberger)
- Breaking Claude Code Opus 5 Auto Mode — simonwillison.net
- Claude Code Opus 5 Auto Mode Hijacked via Prompt Injection — Cyber Security News
Автор
Look at AI, редакция
