Исследование выявило критическую уязвимость AI-агентов, таких как Claude Code и OpenAI Codex: из-за неверного понимания состояния системы агенты могут выполнять деструктивные команды, приводящие к удалению пользовательских файлов и баз данных.

image

Что произошло

Выявлено, что AI-агенты могут ошибочно выполнять команды вроде rm -rf. Это происходит из-за некорректной интерпретации переменных окружения (например, $HOME) или использования неточных регулярных выражений при рефакторинге кода. В результате под угрозой оказываются не только файлы проекта, но и домашние директории пользователей, а также рабочие базы данных, которые агент может принять за тестовые.

Контекст

Проблема заключается в феномене state misunderstanding — непонимании текущего состояния системы. Текущая архитектура многих агентов предоставляет им прямой доступ к «сырому» терминалу без надлежащих ограничений, что превращает любую ошибку в интерпретации контекста в катастрофическую операцию.

Почему это важно для индустрии

Разработчикам необходимо отказаться от предоставления прямого доступа к терминалу в пользу создания инструментов с ограниченной областью действия (scoped operations). Перспективными направлениями являются внедрение песочниц (sandboxing), использование высокоуровневых примитивов для рефакторинга на основе AST (Abstract Syntax Tree) и создание стандартизированных временных хранилищ.

Почему это важно для пользователей

Пользователям рекомендуется использовать защитные механизмы при работе с терминальными агентами: изолировать задачи с помощью Git worktrees и применять специализированные утилиты, такие как destructive_command_guard, для перехвата опасных команд.

Что пока неизвестно / ограничения

Явных технических разногласий по сути проблемы не выявлено, однако акценты в обсуждении смещаются от чисто инженерных рисков к вопросам рыночных возможностей и юридической ответственности.

Источники

Автор

Look at AI, редакция