13 августа 2026 года команда FireRed выпустила FireRedTTS3, систему синтеза речи, код и веса которой опубликованы под лицензией Apache-2.0. В одной модели объединены zero-shot клонирование голоса на 24 языках, включая русский и украинский, дизайн голоса по текстовой инструкции и локальное редактирование уже сгенерированной речи.

image
image
image

Что произошло

Релиз выполнен в двух вариантах. FireRedTTS3-Base выполняет zero-shot клонирование голоса на 24 языках, включая русский и украинский, а также на 21 китайском диалекте. FireRedTTS3-Instruct — единая модель, которая к клонированию добавляет две возможности: дизайн голоса по текстовой инструкции и редактирование речи — вставку, замену и удаление слов, изменение скорости в диапазоне от 0,5x до 2,0x, высоты тона на ±6 шагов и громкости без перезаписи всей записи. Вместе с весами опубликован технический отчёт (arXiv:2608.17492).

Контекст

Технически FireRedTTS3 — непрерывная авторегрессионная модель, работающая на семантически обогащённых представлениях речи, которые генерирует токенизатор RedAE. Ключевая ставка команды — в регуляризации, а не в усложнении: замороженный аудиоэнкодер выступает «семантическим учителем» и стабилизирует пространство представлений, что должно подавлять накопление ошибок авторегрессионной генерации без многоступенчатого обучения токенизатора и громоздкой архитектуры. Отдельного внимания заслуживает и объединение функций: клонирование голоса, дизайн голоса по текстовой инструкции и локальное редактирование речи ранее реализовывались в разных системах и коммерческих API, а FireRedTTS3 собирает их в одной открытой модели.

Почему это важно для индустрии

Команда заявляет, что FireRedTTS3-Base показывает лучшие средние результаты среди сравниваемых систем: на бенчмарке Seed-TTS-eval — WER/CER 3,04% и сходство голоса 78,8, на MiniMax-MLS-Test — WER/CER 3,754% и сходство 84,8. Сравнение включает CosyVoice3-1.5B, Qwen3-TTS, Seed-TTS, VoxCPM2, dots.tts и закрытый ElevenLabs. Для отрасли главный сигнал — сочетание открытых весов с полным набором функций: базовый слой синтеза речи становится ближе к commodity, а для продуктовых команд FireRedTTS3 — self-hosted альтернатива закрытым TTS-API. Паттерн «клонирование + дизайн + редактирование в одной модели» может стать стандартным интерфейсом голосовых продуктов, а при подтверждении качества сообществом и появлении рецептов fine-tuning релиз способен оказывать устойчивое ценовое давление на закрытые API.

Почему это важно для пользователей

Русский язык входит в список 24 поддерживаемых, так что оценить качество можно прямо сейчас, без контрактов: онлайн-демо позволяет прослушать результаты, а веса доступны на Hugging Face и ModelScope, что даёт возможность собрать сопоставление с текущим провайдером. Порог входа в voice-продукт снижается до уровня одного GPU и интеграционных работ; конкретные сценарии — клонирование голоса персонажа бренда по нескольким секундам аудио и генерация устной версии текстового контента. Для русскоязычного пайплайна есть важная оговорка: встроенная нормализация текста (числа, даты, валюты) работает только для китайского и английского, поэтому для полного качества на русском придётся подключать LLM-based нормализацию текста через любой OpenAI-совместимый API — это дополнительная зависимость, латентность и стоимость.

Что пока неизвестно / ограничения

Все приведённые метрики самозаявлены командой в собственном отчёте: условия сопоставимости — версии моделей, длина эталонной речи, конфигурации — в доступных материалах не расписаны, поэтому опережение ElevenLabs стоит считать заявленным результатом, а не независимой проверкой. Независимых воспроизведений и бенчмарков сообщества пока не появлялось. Опубликованных данных по латентности и RTF модели нет, так что перед production-использованием придётся замерить производительность на своём железе и прогнать полный пайплайн от текста до речи. Кроме того, редактирование речи понимает только жёсткие шаблоны команд вида «adjust the speed to 1.5x», а не свободные формулировки, что сужает круг production-сценариев.

Источники

Автор

Look at AI, редакция