24 сентября 2026 года Google выпустила в общий доступ Live Avatar — дополнение к голосовой модели Gemini 3.8 Live, которое почти в реальном времени генерирует видео с говорящим персонажем: с синхронизированной губной артикуляцией, естественной мимикой и плавной сменой реплик. Функция открыта корпоративным клиентам в Gemini Enterprise и через Gemini Live API с эндпоинтами в США и ЕС, минута речи аватара стоит около 39 центов, а весь сгенерированный звук и картинка помечаются невидимым водяным знаком SynthID.



Что произошло
Live Avatar стал видеонадстройкой над голосовой моделью Gemini 3.8 Live, которую Google анонсировала 15 сентября 2026 года. Дополнение почти в реальном времени генерирует видео с говорящим персонажем: синхронизирует артикуляцию губ с речью, воспроизводит естественную мимику и плавно передаёт очередь реплик. В одном потоке модель одновременно принимает от пользователя видео и звук, а вызовы внешних инструментов выполняет в фоне, не прерывая беседу; по заявлению компании, синхронизация губ и мимика адаптируются к 97 языкам, и картинка не деградирует при переключении языка посреди разговора. Функция переведена в статус GA в Gemini Enterprise и через Gemini Live API с эндпоинтами в США и ЕС: готовый набор аватаров открыт всем корпоративным клиентам, а создание собственных персонажей по одному референс-изображению пока возможно только по allowlist-заявке. Весь аудио- и видеовыход помечается невидимым водяным знаком SynthID. Тарификация привязана к выходным токенам: при цене $1 за миллион токенов и расходе 6192 токена на секунду видео минута говорения аватара обходится примерно в 39 центов, из которых около 37 центов приходится на видео и около 2 центов на аудио.
Контекст
Live Avatar дополнил голосовую модель Gemini 3.8 Live менее чем через две недели после анонса самой модели. Google описывает архитектуру как единый поток, в котором модель сразу принимает видео и звук и отвечает лицом, параллельно вызывая внешние инструменты, — вместо классического конвейера speech-to-text, затем языковая модель, затем синтез речи и отдельная генерация видео. Экономику решения хорошо показывает расход токенов: 6192 токена на секунду видео означают, что основную стоимость создаёт именно видеогенерация, а не аудио. Публичное API, GA-статус и опубликованный прайс делают этот запуск редким для категории говорящих видеоаватаров, которые до сих пор чаще существовали в виде демо и research preview.
Почему это важно для индустрии
GA в Gemini Enterprise переводит говорящих видеоаватаров из категории демо в продуктовый контур клиентской поддержки и интерактивных инструкций — на вебе, в мобильных приложениях и киосках, с provisioned throughput и региональными эндпоинтами в США и ЕС. Первые внедрения уже заявлены: Cox Automotive построила аватар для Autotrader, где подбор машины идёт разговором; Equal AI обрабатывает более миллиона живых звонков в день на девяти индийских языках; Salesforce связывает аватар с Agentforce. Обязательная маркировка SynthID задаёт образец, как рынок разговорных агентов может помечать синтетическое видео. Для стартапов «лицо» разговорного агента стало дешёвым и арендуемым компонентом, а вероятная траектория ближайших месяцев — волна внедрений в поддержке и онбординге по образцу этих кейсов и появление независимых замеров латентности и качества от разработчиков, работающих с API.
Почему это важно для пользователей
Это первый GA-доступный «живой» видеоаватар внутри голосового API крупного вендора: агента, который видит через камеру или шаринг экрана, слышит собеседника, говорит лицом и параллельно вызывает ваши API в фоне, можно собрать без самодельного видео-пайплайна и без конвейера speech-to-text. Пилот запускается сразу: GA-статус, готовая библиотека аватаров без заявок и понятная цена с оплатой только за время говорения персонажа делают MVP посильным. Попробовать можно через консоль Gemini Enterprise (Agent Platform Studio, раздел Multimodal Live) и документацию Gemini Live API.
Что пока неизвестно / ограничения
Ключевые capability-утверждения — near-real-time генерация, адаптация артикуляции и мимики к 97 языкам без деградации картинки и сохранение сходства персонажа по одному референс-изображению — даны словами Google и пока не подкреплены методикой, метриками или независимыми замерами. Численная латентность, SLA и лимиты одновременных сессий в источниках не раскрыты, поэтому прод-мощность под нагрузку рассчитать нельзя. Кастомные аватары ограничены allowlist, и сроки расширения списка не названы, а эндпоинты размещены исключительно в США и ЕС — для остальных регионов открытыми остаются вопросы задержки и размещения данных.
Источники
- Introducing Gemini 3.8 Live with Live Avatar (Google Blog)
- Gemini 3.8 Live with Live Avatar is now generally available (Google Cloud Blog)
- Agent Platform Pricing — Gemini 3.8 Live API (Google Cloud)
Автор
Look at AI, редакция
