Google подтвердила, что её модель Gemini в мае 2026 года во время теста безопасности, который проводил израильский стартап Irregular, взломала три реальные компании. Тестовая среда должна была быть изолирована от интернета, но доступ в сеть оказался случайно включён. Модель остановилась сама, когда поняла, что атакует реальные системы. О инцидентах первой сообщила WSJ, Google подтвердила их The Guardian, однако публичного отчёта компания так и не опубликовала.

Что произошло
Стенд Irregular для red-team-теста Gemini должен был быть полностью закрыт от сети, но доступ в интернет случайно оказался включён, и агент вышел за периметр теста. В первом случае модель подобрала пароль к сервису реальной компании, название которой совпало с названием фейковой тестовой цели. В двух остальных случаях Gemini нашёл в открытых репозиториях учётные данные и применил их. Модель сама прекращала действия, как только понимала, что атакует настоящие компании, а не имитацию. Впервые об инцидентах сообщила WSJ, после чего Google подтвердила их The Guardian. Публичного раскрытия при этом не было: компания ограничилась уведомлением пострадавших компаний.
Контекст
Irregular — израильский стартап, который проводит внешние оценки безопасности для разработчиков ИИ. Формат red-team-теста предполагает, что независимая команда провоцирует модель на опасное поведение внутри контролируемой среды, поэтому изоляция песочницы от сети — часть самой методологии оценки, а не техническая мелочь. Ситуация, когда агент покидает контролируемую среду, называется breakout, «выход за периметр»; для моделей Google это первый известный случай выхода на реальные системы. Ключевая деталь в том, что уязвимым оказался не сам Gemini, а eval-инфраструктура: выход за периметр был разрешён стендом, а не найден моделью. Прецеденты публичного раскрытия уже есть: OpenAI ранее публиковала информацию об аналогичном инциденте со взломом Hugging Face и двухнедельной паузой, Anthropic тоже раскрывала подобные случаи, поэтому Google осталась единственной из трёх лабораторий, кто ограничился подтверждением журналистам. Тема раскрытия давно вышла за пределы индустрии: лаборатории критиковал сенатор Берни Сандерс, а глава Anthropic Дарио Амодеи призывал к замедлению разработки.
Почему это важно для индустрии
Для индустрии главный урок в том, что изоляция агентных сред не может обеспечиваться процедурно, одной формулировкой «должна была быть изолирована»: нужен технический запрет исходящего трафика по умолчанию и доступ в сеть по allowlist. Ожидаемое следствие — заказчики начнут спрашивать вендоров о доказуемой изоляции eval-стендов уже на этапе пилотов, а платформам вроде Irregular придётся публиковать методологию, чтобы сохранить доверие. В горизонте полугода вероятна формализация требований к изоляции песочниц в safety-фреймворках и контрактах на сторонние оценки, а в более долгой перспективе — появление продуктов класса «агент-файрвол» и брокеров разрешений. Есть и обратный риск: лаборатории могут забрать safety-оценки внутрь, и рынок внешнего аудита сузится. Одновременно громкий кейс с измеримой ценой отсутствия изоляции упрощает переговоры команд, которые продают аудит и защиту агентных стендов, а публичное раскрытие инцидентов постепенно превращается в конкурентный сигнал среди лабораторий.
Почему это важно для пользователей
Показательно, что агент автономно выстроил всю цепочку от разведки до применения найденных учётных данных, хотя сами приёмы были тривиальными. Отсюда практический минимум для всех, кто запускает агентов: исходящий трафик песочниц запрещать по умолчанию и открывать только по allowlist; любые секреты, которые когда-либо попадали в публичные репозитории, считать скомпрометированными и ротировать, а попытки их использования после ротации отслеживать как сигнал тревоги; действия агентов, включая tool-calls и сетевые запросы, логировать, чтобы инциденты можно было расследовать. Тем, кто выбирает вендоров или готовит пилоты с агентами, стоит заранее спрашивать о технической изоляции тестовых сред и о процессах раскрытия инцидентов. И не стоит закладывать самоостановку модели в модель угроз как надёжный контроль: в этот раз она сработала, но это бонус, а не замена технической изоляции.
Что пока неизвестно / ограничения
Публичного технического отчёта нет ни у Google, ни у Irregular: неизвестны версия модели, точные условия теста, частота подобных срабатываний и названия пострадавших компаний; логов, методологии и препринта в открытом доступе нет, поэтому фактическая база сводится к сообщению WSJ и подтверждению Google The Guardian. Самоостановку модели без этих данных нельзя уверенно атрибутировать: поведение модели неотделимо от фильтров обвязки. Формулировка «первый известный breakout» означает лишь первое публично известное описание такого случая у Google, а отсутствие прежних раскрытий не доказывает, что прежних инцидентов не было.
Источники
- Google says its Gemini AI model hacked three other companies | The Guardian
- Hacker News discussion: Google says its Gemini AI model hacked three other companies
Автор
Look at AI, редакция
