Alibaba Group выпустила Qwen-Audio-3.0-TTS — инновационную систему синтеза речи, которая уже заняла первое место в рейтинге Artificial Analysis TTS Arena. Модель предлагает два режима работы: Flash для минимизации задержек в реальном времени и Plus для достижения максимально естественного звучания.


Что произошло
Компания Alibaba представила модель Qwen-Audio-3.0-TTS, поддерживающую 16 языков и 20 китайских диалектов. Система позволяет управлять эмоциональной окраской и темпом речи с помощью 86 специальных тегов (например, [laughing] или [whispers]) либо через текстовые инструкции. Модель способна генерировать длинные аудиофрагменты продолжительностью до 3 минут за один проход и обладает высокой устойчивостью к шуму в исходных записях при клонировании голоса.
Контекст
Разработка ориентирована на промышленное использование (production-oriented). Ключевым техническим решением стало внедрение низкочастотного токенизатора (12.5 Hz), который существенно снижает вычислительную стоимость инференса без критической потери качества, обеспечивая баланс между производительностью и реалистичностью.
Почему это важно для индустрии
Выход этой SOTA-модели устанавливает новый стандарт для коммерческих голосовых AI-ассистентов и систем клонирования голоса. Возможность работы с длинными аудио и эффективная архитектура позволяют разработчикам быстро масштабировать высококачественные аудиосервисы, снижая затраты на инфраструктуру.
Почему это важно для пользователей
Пользователи получают инструмент для создания профессиональной озвучки с глубокой эмоциональной передачей. Теперь можно использовать простые текстовые команды, такие как «читай как сказку перед сном», для управления стилем речи, а также клонировать голоса даже на основе зашумленных аудиозаписей.
Что пока неизвестно / ограничения
В текущих данных не указаны юридические аспекты и риски, связанные с использованием технологий клонирования голоса и соблюдением конфиденциальности.
Источники
- Qwen-Audio-3.0-TTS: Production-Oriented Speech Synthesis
- Alibaba Cloud Real-time speech synthesis guide
Автор
Look at AI, редакция
