28 сентября 2026 года ElevenLabs выпустила две новые TTS-модели: Eleven v4 для контента и длинных сценариев и Eleven v4 Turbo для голосовых агентов. Обе понимают более 90 языков, включая русский, размечают эмоции инлайн-тегами вроде [laughs], [whispers] и [pause] вместо отключённого SSML и, по данным компании, отвечают первой речью примерно за 150 мс. Первую живую проверку релиз уже прошёл: автор телеграм-канала «Love. Death. Transformers.» встроил Eleven v4 в настольного робота Hugging Face Reachy Mini, и антенны робота стали синхронно повторять эмоции синтезированного голоса.

Что произошло
ElevenLabs выпустила два варианта новой модели под разными model_id: eleven_v4 для контента и длинных сценариев, доступный через Text to Dialogue API, и eleven_v4_turbo для голосовых агентов, работающий через WebSocket с двунаправленным стримингом, рассчитанным на агентные циклы. Модели поддерживают более 90 языков и генерируют до 10 000 символов за один запрос, а «контекст-сшивка» между фрагментами должна сохранять единую подачу в длинных аудиокнигах. Эмоциональная разметка вынесена прямо в текст в виде инлайн-тегов [laughs], [whispers], [pause] — SSML в новых моделях отключён. Поддержка Professional Voice Clones восстановлена, однако старые клоны теперь нужно переобучить под новую архитектуру. По данным официальной страницы ElevenLabs, v4 Turbo даёт около 150 мс медианы времени до первой речи и около 100 мс медианы инференса — против 262 мс у Cartesia Sonic 3.6 и 814 мс у OpenAI GPT-4o mini TTS.
Контекст
У Eleven v3, при заметном качестве речи, были документированные слабые места: диалоги, эмоциональная разметка, клонирование и ограничение длины генерации. Именно их и закрывает четвёртая версия — релиз стоит читать не как улучшение одной функции, а как ответ на накопленные претензии рынка. Более широкая картина была такая: в realtime-звене голосовых агентов до этого задавала тон Cartesia, а решения уровня OpenAI GPT-4o mini TTS оставались заметно медленнее; при этом TTS в целом двигался от роли «озвучки текста» к роли строительного блока агентных продуктов, в котором эмоция становится разметкой, которую может расставлять сама языковая модель. Переход с SSML на инлайн-теги — прямое следствие этой логики: интерфейс между LLM и синтезом речи смещается от декларативной разметки к тегам, вписанным непосредственно в текст, который генерирует модель.
Почему это важно для индустрии
Для отрасли главное — realtime-звено: с заявленной медианой около 150 мс до первой речи ElevenLabs официально становится конкурентом Cartesia в нише voice-агентов, где скорость была определяющим преимуществом одного игрока. Платформа при этом закрывает и длинный контент (Text to Dialogue, аудиотеги, клонирование голосов), и агентов в реальном времени — это заявка на консолидацию голосового слоя: для стартапов вход в голосовые продукты дешевеет и ускоряется, а дифференциация всё сильнее уходит в эмоции, управление диалогом и эргономику API, а не в сам синтез речи. Одновременно миграция становится управляемым обязательством ближайших недель: нужно сменить model_id в API и переобучить старые Professional Voice Clones — те, кто не переедет, остаются на Multilingual v2 без эмоциональной разметки и realtime-латентности. Если траектория от v3 к v4 сохранится, TTS рискует превратиться в commodity-звено агентного стека, где конкуренция идёт вокруг связки «латентность плюс управляемая эмоция».
Почему это важно для пользователей
Читателям релиз даёт несколько практических вещей сразу. Русский голос можно генерировать среди 90+ поддерживаемых языков, а промо-тариф с утроенными кредитами на планах Creator+ действует до 12 октября 2026 года — этого окна хватает, чтобы запустить пилот и замеры практически бесплатно. Тем, кто слушает аудиокниги и подкасты, достанется более стабильная подача длинных записей: генерация идёт крупными фрагментами, которые «сшиваются» по контексту, без сбивчивого темпа между главами. Билдерам личных ботов и роботов особенно показателен приём из демки: автор поста встроил Eleven v4 в настольного робота Hugging Face Reachy Mini и запрограммировал его антенны повторять эмоции голоса — код для этого написал Claude Opus 5.5, парсящий эмоциональную разметку v4 и синхронизирующий движения с интонациями в реальном времени. Смысл приёма шире игрушки: «эмоция» голосового агента перестаёт быть только звуком и может управлять внешними реакциями устройства — потенциальным каналом для embodied-интерфейсов вокруг синтезированной речи.
Что пока неизвестно / ограничения
Все численные характеристики — около 150 мс, около 100 мс и формулировка «самая лучшая TTS в мире» — это самоотчёт ElevenLabs без опубликованной методологии и независимых воспроизведений. Латентность дана только медианами: в поданных источниках нет перцентилей p95/p99, описания железа, сети и нагрузки агентного цикла, а realtime-системы обычно ломаются именно на хвостах распределения — поэтому суждение, что планка для человечных голосовых агентов уже пройдена, делать рано. В латентном сравнении использована слабая база OpenAI GPT-4o mini TTS с 814 мс, выгодно контрастирующая с цифрами вендора, тогда как настоящий соперник Cartesia Sonic 3.6 отстаёт лишь примерно на 110 мс — классический признак выборочного подбора точек сравнения. Отказ от SSML в пользу инлайн-тегов остаётся дизайнерским решением без публичной оценки: никто не измерил, насколько стабильно модель интерпретирует теги, особенно в языках, отличных от английского. Сценарии вроде «LLM сама расставляет эмоциональные теги как стандарт» и «инлайн-теги вытеснят SSML» — интерпретации, не подтверждённые источниками; то же касается превращения TTS в интерфейсный слой между агентом и его «телом».
Источники
- Eleven v4 & Eleven v4 Turbo — Text to Speech Models (elevenlabs.io/v4)
- ElevenLabs Changelog: Eleven v4 & v4 Turbo launch, September 28, 2026
Автор
Look at AI, редакция
