Google 30 сентября 2026 года официально представила Gemini 4 Argon — новую frontier-модель для сложных многошаговых задач: реального инженерного кодинга, корпоративной работы в финансах и праве и кибербезопасности. Главная техническая особенность — лимит выходных токенов, поднятый до 1 млн против 64K у предыдущего поколения: агент может довести длинную задачу до конца в одной траектории, а не собирать её из коротких шагов. Компания заявляет 77,9% на DeepSWE v1.1 и первые места на AutomationBench Zapier и CWE-bench v1, а доступ пока ограничен: расширение начнётся с платных API-клиентов и подписчиков Google AI Ultra.


Что произошло
Объявление, подписанное Кораем Кавукчуоглу, старшим вице-президентом Google DeepMind, вышло 30 сентября 2026 года. Компания называет Argon frontier-моделью и впервые поднимает лимит выходных токенов до 1 млн против 64K у предыдущего поколения, что позволяет модели выдавать сотни тысяч токенов рассуждений в одной траектории. На бенчмарках заявлены 77,9% на DeepSWE v1.1 — SOTA впереди Claude Opus 5.5 с 74,2% и GPT-6 Astra с 74,1%, первое место на AutomationBench Zapier с 51,3%, 91,7% на LVBench по длинным видео и разделившееся первое место на CWE-bench v1 по исправлению уязвимостей с результатом 68%. Во внутренних проектах Google агенты Argon мигрировали на Rust кодовые базы C/C++ объёмом до 800K+ строк, включая ядро Fuchsia Zircon, а также переработали 32 000 строк SIMD-кода в libgav1, получив ускорение в 2,7 раза против предыдущего Rust-порта и освободив более 300 TiB памяти. В кибербезопасности модель автономно находит, проверяет и патчит критические уязвимости, а для проверенных защитников доступен вариант без cyber-guardrails.
Контекст
Появление Argon — ход в конкуренции frontier-моделей за длинные агентные траектории. В предыдущем поколении лимит вывода ограничивался 64K токенов, поэтому сложные задачи приходилось собирать из последовательности коротких вызовов: в одном проходе не помещалась ни миграция крупной кодовой базы, ни сквозной аудит уязвимостей. Прямые соперники в агентном кодинге — Claude Opus 5.5 от Anthropic и GPT-6 Astra от OpenAI, и Google впервые выставляет против них свои цифры в открытую. Отдельный пласт — доверие и безопасность: Google называет Argon устойчивейшей к prompt injection моделью со ссылкой на лидерство в бенчмарке Gray Swan IPI, а также участвует в добровольном процессе pre-release доступа правительства США. По состоянию на объявление Argon остаётся моделью, которую тестирует ограниченный круг пользователей, а не готовым продуктом для всех; Google при этом заявляет об усилении защиты от злоупотреблений.
Почему это важно для индустрии
Для строителей агентных систем главный сдвиг — не сама таблица бенчмарков, а единица экономики: траектории до 1 млн выходных токенов превращают длинные проекты, от миграции кода и разбора репозитория до аудита уязвимостей, из ручного труда с почасовой оплатой в задачу с предсказуемой токен-стоимостью, открывая класс продуктов «долгая задача как сервис». Заявленные результаты на DeepSWE v1.1, AutomationBench и CWE-bench v1 напрямую затрагивают позиции Anthropic и OpenAI в агентном кодинге и корпоративной автоматизации, что повышает вероятность волны ответных релизов с поднятыми лимитами вывода и нового раунда пере-бенчмаркинга. В кибербезопасности формируется отдельная ниша: автономный поиск, проверка и патчинг критических уязвимостей через программу Fairwind и партнёрство с Wiz в рамках Scan for Good, где версия без cyber-guardrails выдаётся только проверенным защитникам. Командам имеет смысл уже сейчас пересчитать юнит-экономику под конечные цены $4/$20 за 1M токенов и проектировать UX длинных траекторий: чекпоинты, отображение прогресса, human-in-the-loop ревью и воспроизведение шагов.
Почему это важно для пользователей
Для читателя Gemini 4 Argon пока не для всех: Google тестирует модель с ограниченным кругом пользователей и усиливает защиту от злоупотреблений, а расширение доступа начнётся с платных API-клиентов и подписчиков Google AI Ultra. При наличии бюджета стоит следить за открытием API: вводная цена составляет $2 за 1M входных и $10 за 1M выходных токенов, кэшированный вход дешевле на 95%, а после вводного периода тариф вырастет до $4 и $20 за 1M. Практический смысл для разработчика — новые уровни на длинных задачах: рефакторинг крупных кодовых баз, миграции между языками, разбор длинных видео и поиск уязвимостей в одном запуске вместо цепочки вызовов. Пока доступ не открыт, реальная польза — собрать собственный eval-набор под свои длинные задачи и заранее посчитать экономику под обе шкалы цен, чтобы сравнить Argon с текущим стеком в первый же день открытия API.
Что пока неизвестно / ограничения
Все цифры бенчмарков (77,9% на DeepSWE v1.1, 51,3% на AutomationBench Zapier, 91,7% на LVBench, 68% на CWE-bench v1) заявлены самим Google, а методология оценки в доступных источниках не раскрыта: нет данных о pass@k, числе запусков, температуре и контроле контаминации. Отрыв на DeepSWE v1.1 от Claude Opus 5.5 и GPT-6 Astra составляет около 3,7 процентного пункта — на агентных бенчмарках такая разница легко съедается разбросом между запусками. Разделившееся первое место на CWE-bench v1 прямо указывает на наличие минимум одного сопоставимого конкурента, так что нарратив безусловного лидерства слабее, чем заголовок. Внутренние кейсы — перенос ядра Fuchsia Zircon на Rust и переписывание SIMD-кода в libgav1 — опираются на внутренние проекты Google и независимо не проверены, а тезис о сотнях тысяч токенов рассуждений в одной траектории пока основан на этих же кейсах. Конкретные сроки расширения доступа за пределами последовательности «платные API-клиенты, затем Google AI Ultra» в источниках не названы.
Источники
- Introducing Gemini 4 Argon — The Keyword (Google blog)
- Google announces Gemini 4 Argon as its new frontier model — 9to5Google
- Google rolls out Gemini 4 Argon, its most advanced model — CNBC
Автор
Look at AI, редакция
