OpenAI опубликовала пост «GPT-6 Astra: The next generation in intelligence for work» с внутренними кейсами модели, вышедшей 3 сентября. Главная демонстрация — Astra через computer use вместе с Codex сама смонтировала три часа мультикамерной съёмки в готовый ролик, управляя приложениями монтажа и не прибегая к выделенному API.



Что произошло
Команды разработчиков и маркетинга OpenAI довели до результата задачу пост-продакшна: Astra через computer use открывала приложения монтажа, находила нужные фрагменты среди трёх часов мультикамерной съёмки и собрала из них видео «First impressions of GPT-6 Astra from developers». Ролик загружен 3 сентября и за 4 дня набрал более 550 тыс. просмотров. В том же посте компания привела ещё два кейса. Astra через computer use решает задания Financial Modeling World Cup, чемпионата по Excel 2023 года, примерно в 4 раза быстрее человека-победителя. Инжиниринговая команда с помощью модели нашла bottleneck в выделении памяти в тестовой среде Codex: после смены allocator задержка turn latency упала в 25 раз, а пиковая память выросла примерно на 30%. Публикация кейсов сопровождала выход модели, начало rollout которой 3 сентября сообщал CNBC. Публичный API-прайсинг Astra составляет $10/$50 за млн токенов, а на Terminal-Bench 4.0 модель показала 57,9% против 37,3% у GPT-5.6 Sol и 55,8% у Claude Fable 5.1.
Контекст
Computer use — режим работы модели, при котором агент управляет готовым программным обеспечением через интерфейс: открывает приложения, находит нужные объекты на экране и выполняет действия, не требуя от разработчика специальных интеграций. У профессиональных программ видеомонтажа (NLE) выделенных AI-интеграций для Astra нет, поэтому продемонстрированный монтаж происходил в уже существующих приложениях. Financial Modeling World Cup — соревнования по Excel, результат которых за 2023 год компания использует как публичный ориентир для оценки модели. Для сравнения на Terminal-Bench 4.0 приведены GPT-5.6 Sol — более ранняя модель OpenAI — и Claude Fable 5.1, модель конкурента, так что заявленные цифры можно читать как отрыв от предыдущего поколения и от ближайших конкурентов.
Почему это важно для индустрии
Для отрасли демонстрация показывает, что фронтирная модель общего назначения выполняет профессиональный пост-продакшн внутри существующих NLE без интеграций, и конкуренция смещается от цены токена к стоимости законченной задачи: меньше шагов и повторных попыток означает дешевле готовый результат. Опубликованные OpenAI прайсинг и бенчмарк-результаты дают компаниям рабочий ориентир при выборе модели под агентные нагрузки. Под прямым давлением оказываются специализированные ИИ-монтажные и генеративные стартапы, чья ценность строилась на пайплайне под одну конкретную задачу: тонкие обёртки без собственного moat теряют аргументы перед клиентами и инвесторами. Для product-команд это новый UX-паттерн «задача на входе, готовый артефакт на выходе», и поверх Astra и Codex уже сейчас можно собирать оркестрацию длинных компьютерных задач.
Почему это важно для пользователей
Для читателя кейс — наглядный ориентир по уровню computer use: модель не просто описывает видео, а сама управляет приложением и доводит монтаж до результата. Готовый ролик можно посмотреть на YouTube-канале OpenAI, а те, у кого есть доступ к ChatGPT Work или Codex, могут попробовать подобные сценарии самостоятельно и считать экономику не по цене токена, а по стоимости готовой задачи. При этом стоит помнить, что выделенного API под монтаж нет: computer use в профессиональных NLE — это не готовая интеграция, а сценарий, который в длинных цепочках действий может дать сбой.
Что пока неизвестно / ограничения
OpenAI не раскрывает методологию демонстраций. Монтаж трёхчасового ролика — одноразовый demo-кейс без протокола, числа попыток, данных об ошибках и стоимости запущенных токенов, поэтому он не доказывает надёжность длинных агентных задач. По Terminal-Bench 4.0 в доступных материалах нет деталей агентной настройки — pass@k, числа попыток, scaffolding, таймаутов — и независимых воспроизведений результата. Заявление о Financial Modeling World Cup смешивает метрики времени и точности и не раскрывает условия запуска, а кейс с allocator в Codex — единичный пример без error analysis. Все приведённые цифры следует считать заявленными, а не независимо верифицированными.
Источники
- GPT-6 Astra: The next generation in intelligence for work — OpenAI
- First impressions of GPT-6 Astra from developers — YouTube, канал OpenAI
- OpenAI announces rollout of GPT-6 Astra model — CNBC
Автор
Look at AI, редакция
