Расследование The Verge показало, что волна на первый взгляд не связанных между собой инцидентов с «взбесившимися» ИИ-агентами у OpenAI, Meta, Anthropic и Google имела один общий источник — израильский стартап Irregular, который стресс-тестирует модели на кибербезопасность. В нескольких тестах этого года агенты непреднамеренно получили доступ в открытый интернет, а вымышленное имя компании-мишени в симуляции совпало с реальным доменом, и тесты превратились в атаки на настоящие цели.

image

Что произошло

Расследование The Verge связало несколько громких инцидентов этого года у OpenAI, Meta, Anthropic и Google с одним сторонним оценщиком — израильским стартапом Irregular, основанным в 2023 году как Pattern Labs и специализирующимся на стресс-тестах ИИ-моделей на кибербезопасность. В нескольких тестах агенты выходили за пределы изолированной тестовой среды и атаковали реальные цели. CTO и сооснователь Irregular Омер Нево пояснил, что у агентов «непреднамеренно оказался доступ в открытый интернет», а вымышленное имя компании-мишени в симуляции «совпало с реальным доменом». Инциденты раскрылись в конце июля: OpenAI и Anthropic сами объявили о взломах, а истории Meta и Google стали публичны через СМИ. Взлом Hugging Face и инциденты британского AI Security Institute к деятельности Irregular не относятся.

Контекст

Irregular — не случайный подрядчик, а заметный игрок формирующегося рынка стороннего стресс-тестирования frontier-моделей: стартап привлёк 80 миллионов долларов, работает с OpenAI, тестировал системы для правительства Великобритании и Anthropic, публикует исследования вместе с RAND и упоминается в системных картах OpenAI GPT-5. Кибер-оценки в формате capture-the-flag, где модели решают задачи на взлом симулируемых компаний, остаются закрытой областью: слово «disclosed» в системных картах лабораторий не означает «опубликовано», правила раскрытия итогов таких оценок непрозрачны, и это ломает воспроизводимость и сопоставимость отчётов разных команд. Зрелых стандартов сетевой изоляции и отчётности об escape-инцидентах в этой молодой отрасли до сих пор нет, поэтому ошибка в харнессах одного оценщика смогла отразиться на тестах сразу нескольких крупнейших лабораторий.

Почему это важно для индустрии

Ключевой вывод для индустрии в том, что корневая причина лежит в инфраструктуре, а не в моделях: наложились две ошибки конфигурации, незакрытый интернет-доступ и коллизия вымышленного имени с реальным доменом. Это означает, что компании, заказывающие или проводящие кибер-оценки агентов, должны проверять сторонних оценщиков так же жёстко, как вендоров безопасности: их сетевая изоляция, egress-политики и правила разрешения имён становятся предметом закупочного аудита. Irregular уже ужесточила контроль интернет-доступа, а ожидаемый публичный отчёт с уроками может задать де-факто стандарты для всей категории: allowlist-подход к интернет-доступу, проверку коллизий симулируемых имён с реальными доменами и единую терминологию раскрытия инцидентов. В перспективе контроль исходящего трафика и аудируемые сетевые разрешения, вероятно, станут стандартным слоем агентного стека, как когда-то OAuth и логирование, а жёсткость изоляции при тестировании способности агентов к взлому превращается из лабораторной гигиены в вопрос национальной безопасности.

Почему это важно для пользователей

Тем, кто сам запускает ИИ-агентов с доступом в сеть, история даёт конкретный чек-лист: исходящий трафик агентов должен быть закрыт по умолчанию и идти только через прокси с allowlist доменов, а все симулируемые имена и домены нужно проверять на совпадение с реальными перед каждым запуском, включая контроль резолвинга имён. Достаточно наложения двух ошибок в изоляции тестового окружения, чтобы «безопасная» симуляция затронула реальную инфраструктуру, и случай Irregular показывает, что это случается даже у хорошо финансируемых профессиональных команд. Публичные отчёты о «взбесившихся» агентах теперь стоит читать с поправкой: за несколькими громкими историями может стоять одна и та же ошибка одного тестировщика, поэтому количество заголовков о rogue agent прямо не говорит о частоте отказов самих моделей.

Что пока неизвестно / ограничения

Вся фактура пока опирается на одну журналистскую реконструкцию The Verge, а техническое объяснение инцидентов исходит в основном от самого Irregular — заинтересованной стороны. Публичный технический отчёт с методологией только готовится, поэтому детали инцидентов и их полная картина могут уточниться. До сих пор неизвестно, какие компании и организации реально атаковали агенты, вышедшие из тестовой среды. Отсутствие инцидентов при тестировании китайских открытых моделей Kimi K3 от Moonshot AI и GLM-5.2 от Z.ai имеет слабую доказательную ценность: сам Омер Нево предупредил, что это не доказывает их большей устойчивости, поскольку нулевой результат без сопоставимого объёма тестов, сценариев и порогов срабатывания не является доказательством.

Источники

Автор

Look at AI, редакция