15 сентября 2026 года Google выпустила две live-модели, Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking, которые обрабатывают непрерывные потоки аудио, видео и текста, отвечают голосом в реальном времени и поддерживают 97 языков с автоматическим переключением прямо в разговоре.

image
image

Что произошло

Обе версии видят изображение с камеры почти в реальном времени и запускают инструменты и API-вызовы в фоне, не прерывая речь. Gemini 3.8 Live Extended Thinking рассуждает и говорит одновременно, сопровождая фоновые многошаговые задачи живым комментарием. По данным Google, Extended Thinking занял 1-е место в Speech to Speech Quality Index от Artificial Analysis с 82,6 балла, показал 68,6% на tau-Voice, 35,1% на tau-Voice-banking от Sierra и 97,7% на Big Bench Audio; Gemini 3.8 Live занял 2-е место в Speech Agent Arena. Цены платного тарифа Gemini API за 1 млн токенов одинаковы для обеих моделей: вход — текст $0,75, аудио $3; выход — текст $4,50, аудио $12. Обе версии доступны в Gemini API и Google AI Studio, включая бесплатный доступ, а корпоративным клиентам открыта private preview Gemini Enterprise. Google анонсировала интеграции через Live API с Agora, LiveKit, Pipecat, LangChain и Vercel, а также партнёрства с Salesforce и Genspark.

Контекст

Для понимания релиза важно, какую привычную проблему он решает: традиционные голосовые ассистенты выполняли задачу и оставались молча, пока пользователь ждал результат. Gemini 3.8 Live вводит противоположный сценарий, в котором ассистент продолжает говорить, пока инструменты и API-вызовы выполняются в фоне, а в версии Extended Thinking рассуждение идёт параллельно с речью. При этом выпуск носит прежде всего инженерно-продуктовый характер: научная новизна моделей не подтверждена техническим отчётом и абляциями, и на момент анонса главная ценность релиза — в способностях, готовом API и цене, а не в исследовательских результатах.

Почему это важно для индустрии

Разработчики голосовых агентов получили production-инструмент, который убирает главное ограничение категории: диалог перестаёт замолкать на время выполнения задачи. Опубликованное единое ценообразование за аудио- и текстовые токены задаёт ориентир для экономики голосовых агентов, вокруг которого конкурентам придётся выстраивать собственные тарифы. Готовые интеграции и партнёрства ускоряют появление голосовых интерфейсов в продуктах и сжимают путь от идеи до работающего демо до нескольких дней, так как собственная связка распознавания и синтеза речи для пилота больше не нужна.

Почему это важно для пользователей

Модели можно бесплатно попробовать в Google AI Studio и через Gemini API и собрать собственного голосового агента без своего стека ASR и TTS. Обычные пользователи получат новый голосовой режим в Gemini Live, Search Live и в Workspace (Docs Live, Gmail Live, Keep Live) — с пониманием того, что происходит на экране и в кадре.

Что пока неизвестно / ограничения

Все приведённые метрики — это цифры, заявленные Google: нет ни независимой репликации, ни описания протокола оценки, ни failure-анализа. Технического отчёта, абляций и описания архитектуры нет, поэтому утверждения о production-готовности и платформенном сдвиге остаются маркетинговыми формулировками, а не верифицированными результатами. Отсутствуют поязыковая разбивка качества, замеры латентности и раскрытая end-to-end задержка. Результат 97,7% на Big Bench Audio не переносится автоматически на надёжность в сложных production-сценариях, а разрыв между 68,6% на tau-Voice и 35,1% на tau-Voice-banking показывает, что сложные многошаговые tool-задачи в голосовом канале ещё далеко не насыщены. Корпоративный доступ пока ограничен private preview Gemini Enterprise без публичных SLA.

Источники

Автор

Look at AI, редакция