Alibaba Group выпустила Qwen-Audio-3.0-TTS — инновационную систему синтеза речи, которая уже заняла первое место в рейтинге Artificial Analysis TTS Arena. Модель предлагает два режима работы: Flash для минимизации задержек в реальном времени и Plus для достижения максимально естественного звучания.

image
image

Что произошло

Компания Alibaba представила модель Qwen-Audio-3.0-TTS, поддерживающую 16 языков и 20 китайских диалектов. Система позволяет управлять эмоциональной окраской и темпом речи с помощью 86 специальных тегов (например, [laughing] или [whispers]) либо через текстовые инструкции. Модель способна генерировать длинные аудиофрагменты продолжительностью до 3 минут за один проход и обладает высокой устойчивостью к шуму в исходных записях при клонировании голоса.

Контекст

Разработка ориентирована на промышленное использование (production-oriented). Ключевым техническим решением стало внедрение низкочастотного токенизатора (12.5 Hz), который существенно снижает вычислительную стоимость инференса без критической потери качества, обеспечивая баланс между производительностью и реалистичностью.

Почему это важно для индустрии

Выход этой SOTA-модели устанавливает новый стандарт для коммерческих голосовых AI-ассистентов и систем клонирования голоса. Возможность работы с длинными аудио и эффективная архитектура позволяют разработчикам быстро масштабировать высококачественные аудиосервисы, снижая затраты на инфраструктуру.

Почему это важно для пользователей

Пользователи получают инструмент для создания профессиональной озвучки с глубокой эмоциональной передачей. Теперь можно использовать простые текстовые команды, такие как «читай как сказку перед сном», для управления стилем речи, а также клонировать голоса даже на основе зашумленных аудиозаписей.

Что пока неизвестно / ограничения

В текущих данных не указаны юридические аспекты и риски, связанные с использованием технологий клонирования голоса и соблюдением конфиденциальности.

Источники

Автор

Look at AI, редакция