OpenAI 3 сентября 2026 объявила о запуске GPT-6 Astra — новой флагманской модели, которую компания называет «самой умной и выровненной в мире». Главная особенность модели — результат 100% на ExploitBench, после которого Astra первой пересекла критический кибербезопасностный порог Preparedness Framework OpenAI. Доступ к модели открывается поэтапно: сначала enterprise-подрядчики программы Daybreak, а в ближайшие дни модель станет доступна подписчикам ChatGPT, разработчикам через API и клиентам AWS.

Что произошло
OpenAI привела следующие заявленные результаты GPT-6 Astra: FrontierMath Tier 4 v2 — 97,6%, DeepSWE v1.1 — 74,1%, BenchCAD — 95,9%, GPQA Diamond — 96%, ExploitBench — 100%, ARC-AGI-3 — 98,6%. Компания уточняет, что ARC-AGI-3 измерялась в конфигурации через Responses API. По словам Aidan Clark, это крупнейший на сегодня запуск OpenAI: впервые дообучение прошло на более чем 100 000 GPU на площадке Stargate в Техасе, а Astra стала одной из первых моделей такого класса, в обучении которой предыдущие модели существенно участвовали в супервизии. API-цена установлена на уровне $10 за миллион входных токенов и $50 за миллион выходных. Доступ открывается поэтапно: enterprise-подрядчики программы Daybreak получают его с четверга, а в ближайшие дни модель появится у подписчиков ChatGPT Plus, Pro, Business и Enterprise, а также в OpenAI API и на AWS.
Контекст
Preparedness Framework OpenAI задаёт пороги возможностей для фронтир-моделей: кибербезопасностный порог считается пересечённым, когда модель находит неизвестные уязвимости и цепочки эксплойтов без непрерывного человеческого руководства. Для работы с такими моделями у компании есть программа Daybreak и её расширенная версия Daybreak Blue с мониторингом и ZDR-доступом для подрядчиков. GPT-6 Astra появляется в API под именем gpt-6-astra. Отдельного внимания заслуживает методология: по словам OpenAI, это одна из первых моделей класса, в дообучении которой предыдущие модели существенно участвовали в супервизии, и компания рассматривает это как новый вектор методологии обучения, который обозначается как model-supervised training, а не просто как рост масштаба.
Почему это важно для индустрии
Результат 100% на ExploitBench меняет отраслевой стандарт оценки рисков: Astra стала первой моделью, пересёкшей критический кибербезопасностный порог Preparedness Framework, то есть автономно находящей неизвестные уязвимости и цепочки эксплойтов, а рамка доступа и работы с такими моделями определяется расширенной программой Daybreak Blue с мониторингом и ZDR-доступом. При этом заявленное лидерство в агентном кодинге не подтверждено: DeepSWE v1.1 у Astra — 74,1% против 75,4% у Meta Muse Spark 1.3, и разница около 1,3 процентного пункта укладывается в шум бенчмарка. Цена $10 за миллион входных и $50 за миллион выходных токенов приравнивает Astra к Anthropic Fable 5.1 и делает её в 2,5 раза дороже акционного OpenAI Sol, фиксируя верхний ценовой якорь фронтир-класса и превращая выбор модели в вопрос юнит-экономики конкретных сценариев. Для security-команд модель, способная автономно находить уязвимости, становится новым фактором в модели угроз, который требует переоценки экспозиции.
Почему это важно для пользователей
В ближайшие дни gpt-6-astra появится в OpenAI API и в ChatGPT, ориентир по цене — $10 за миллион входных и $50 за миллион выходных токенов. Enterprise-подрядчики программы Daybreak получили доступ с четверга, а подписчики ChatGPT Plus, Pro, Business и Enterprise могут ожидать появления модели в ближайшие дни. Поскольку Astra в 2,5 раза дороже акционного OpenAI Sol, переносить production-нагрузки на неё без замеров латентности и throughput на собственном трафике нецелесообразно, разумнее сначала подготовить evals и протестировать конкретные сценарии. Подтверждённая сильная сторона Astra — математика и кибербезопасность, которые подтверждены независимыми разборами, тогда как в кодинге модель пока не превосходит ближайших конкурентов. Формулировки про «эпоху AGI» — это слова президента OpenAI Greg Brockman с пресс-брифинга, а не формально верифицированное заявление: OpenAI сама называет AGI серым, размытым понятием.
Что пока неизвестно / ограничения
Все заявленные цифры — vendor-reported данные OpenAI без полного описания методологии. Независимыми разборами на данный момент подтверждены только результаты по математике и кибербезопасности, а по остальным бенчмаркам, включая DeepSWE v1.1 и 95,9% на BenchCAD, независимая воспроизводимость ещё не завершена. Результат 98,6% на ARC-AGI-3 измерен в конкретной конфигурации через Responses API, поэтому прямое сравнение с другими моделями без учёта harness и конфигурации некорректно. Латентность и throughput модели под реальной production-нагрузкой не опубликованы.
Источники
Автор
Look at AI, редакция
