10 сентября 2026 года OpenAI открыла API у GPT-Live-1 — полнодуплексной голосовой модели, которая с июля работает в голосовом режиме ChatGPT. Фронтенд слушает и говорит одновременно, сам обрабатывает перебивания и фоновый шум, а рассуждения и вызовы инструментов передаёт отдельной бэкенд-модели, так что разговор продолжается, пока та считает.


Что произошло
В день релиза OpenAI объявила, что GPT-Live-1 теперь доступна разработчикам по API. Единый речевой стек модели заменяет традиционный каскад STT–LLM–TTS, в котором распознавание, языковая модель и синтез работали по очереди: теперь и перебивания, и фоновый шум обрабатываются внутри одной модели. Фронтенд GPT-Live-1 стоит $0,05 за минуту разговора, вызовы бэкенд-модели тарифицируются отдельно. API поддерживает телефонию, 12 новых голосов, ASR-транскрипты и настройку темпа и тона через инструкции. Среди ранних клиентов названы Speak, Yelp Host, Fin от Intercom и Devin от Cognition. По замерам OpenAI, задержка ответа снизилась с 1,4 до 0,8 секунды, а у Speak число ложных прерываний сократилось примерно на 80%.
Контекст
GPT-Live-1 не появилась вместе с API: модель с июля 2026 года работает в голосовом режиме ChatGPT, то есть открытие API — коммерциализация уже отлаженного продакшен-пайплайна, а не новое демо. До этого полнодуплексные голосовые интерфейсы строили на каскадах: распознаватель превращал речь в текст, LLM формулировала ответ, синтезатор озвучивал его, а паузы и «потерянные» перебивания были побочным эффектом такой схемы. В официальных материалах OpenAI новая модель сравнивается с предшественницей GPT-Realtime-2.1, а механизм делегирования в бэкенд — в GPT-6 Astra или в сторонние модели через Responses delegation — позволяет держать «речевой фронтенд» и «мозг» агента раздельными компонентами.
Почему это важно для индустрии
Для отрасли главное в том, что голосовые агенты перестают быть склеенным конвейером «распознавание + LLM + синтез»: полнодуплексный голосовой фронтенд, отделённый от модели рассуждений, меняет архитектуру телефонии и клиентского сервиса, потому что голосовая линия не обрывается, пока бэкенд выполняет инструменты. Цена $0,05 за минуту и возможность подключить бэкенд-модель не от OpenAI делают GPT-Live-1 базовым инфраструктурным API для voice-агентов. Голосовой конвейер превращается из продукта в инфраструктуру: запуск live-голосовых агентов резко удешевляется, а защищаемость стартапов смещается из речевого стека в данные, воркфлоу и дистрибуцию.
Почему это важно для пользователей
Для разработчиков API доступен уже сейчас: есть WebRTC quickstart, 12 голосов, ASR-транскрипты и управление темпом и тоном через системные инструкции, поэтому полнодуплексного голосового агента можно собрать без собственного каскада STT–LLM–TTS. Цена запуска голосового MVP падает до $0,05 за минуту за фронтенд плюс оплата бэкенд-модели. Пользователи голосовых ботов получат перебивание «на лету» и разговор без пауз, пока агент думает и вызывает инструменты.
Что пока неизвестно / ограничения
Количественные заявления пока не подтверждены независимыми замерами. Преимущество в ~30 процентных пунктов над GPT-Realtime-2.1 по Full Duplex Bench приведено без ссылки на методологию: состав тестовой выборки, метрики и условия сравнения в доступных источниках не раскрыты. Снижение задержки с 1,4 до 0,8 секунды и сокращение ложных прерываний на 80% — собственные замеры OpenAI, причём метрика прерываний частично цитируется как операционный показатель клиента Speak, а протокол измерений и условия — железо, загрузка, состав шума — не опубликованы. До появления независимых оценок цифры по задержке и прерываниям стоит валидировать на собственных нагрузках, а не по анонсу.
Источники
Автор
Look at AI, редакция
