15 сентября 2026 года Google представила две живые голосовые модели, Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking, которые переводят голосового ассистента из категории демо-возможности в готовый production-ready продукт с опубликованными ценами API и оценками внешнего качества речи.

image

Что произошло

Анонс опубликован 15 сентября 2026 года и включает два варианта моделей с идентификаторами gemini-3.8-live и gemini-3.8-live-extended-thinking. Модели работают с 97 языками, автоматически переключая язык посреди разговора, обрабатывают видео и изображения с камеры в почти реальном времени и выполняют вызовы инструментов и API в фоне, не прерывая речь пользователя. Версия Gemini 3.8 Live Extended Thinking рассуждает и говорит одновременно, озвучивая промежуточные шаги многошаговых задач в формате живого нарратива прогресса. По данным Google, расширенная версия заняла 1-е место в целом в Artificial Analysis Speech to Speech Quality Index с результатом 82,6 балла, набрала 68,6% на τ-Voice, 35,1% на Sierra τ-Voice-banking и 97,7% на Big Bench Audio, а Gemini 3.8 Live стала 2-й в Speech Agent Arena. Стоимость API за 1 млн токенов составляет $0,75 на вход и $4,50 на выход для текста, $3/$12 для аудио.

Контекст

Релиз относится к классу нативных speech-to-speech моделей, где одна модель напрямую воспринимает и произносит речь, заменяя традиционную цепочку из распознавателя речи, текстовой модели и синтезатора, в которой каждый проход диалога проходит через несколько стадий. Приведенные в анонсе оценки качества опираются на внешние площадки, индексы Artificial Analysis и Speech Agent Arena, а также на бенчмарки τ-Voice, Sierra τ-Voice-banking и Big Bench Audio, поэтому заявленный уровень можно перепроверить независимыми замерами.

Почему это важно для индустрии

Для отрасли релиз задает ориентир в обеих ключевых категориях рынка реалтайм-голосовых агентов: опубликованные тарифы API становятся ценовой планкой, а бенчмарк-результаты моделей становятся качественной планкой, против которой теперь будут мерить конкурентов. Production-ready голосовые модели с фоновым выполнением инструментов и озвученным рассуждением дают компаниям готовый инфраструктурный слой для многошаговых голосовых процессов, таких как заказы, бронирование и поддержка, без собственной сборки голосового стека из каскадных компонентов. При этом разрыв между результатом модели на общесистемном бенчмарке τ-Voice и доменном Sierra τ-Voice-banking показывает заметное падение качества в прикладных сценариях вроде банкинга, что ограничивает применение таких агентов в критичных бизнес-процессах, пока этот разрыв не будет закрыт.

Почему это важно для пользователей

Разработчики могут прямо сейчас бесплатно опробовать gemini-3.8-live и gemini-3.8-live-extended-thinking в Google AI Studio, подключить их к собственным voice-агентам через Gemini API, прогнать A/B-сравнение с текущим каскадом STT/LLM/TTS по латентности, разборчивости и стоимости и рассчитать себестоимость собственных голосовых сценариев по опубликованным ценам за токены. Обычные пользователи начнут встречать эти модели по мере их внедрения в продукты Google: Search Live, Gemini Live и Workspace.

Что пока неизвестно / ограничения

Все бенчмарк-числа в анонсе приведены со ссылкой «по данным Google», методология замеров не опубликована, а независимой репликации результатов нет. Публичного технического отчета, описывающего архитектуру и метод обучения режима Extended Thinking, в источниках нет, поэтому новизна режима пока подтверждена только самим анонсом. Результат 97,7% на Big Bench Audio, вероятно, отражает насыщение этого бенчмарка и слабо информативен о фактических возможностях модели. Фактическая латентность, надежность и качество голоса в реальных сценариях пока не опубликованы и должны быть проверены независимым тестированием.

Источники

Автор

Look at AI, редакция