Xiaomi опубликовала MiDashengLM-Gen — end-to-end модель, которая по структурированному тексту в одном потоке генерирует речь, музыку, звуковые эффекты и акустическую среду, замещая конвейер из отдельных аудио-моделей. Чекпоинт, код и онлайн-демо уже доступны всем, и модель можно запустить локально.

image
image
image

Что произошло

Команда (репозиторий xiaomi-research, модель публикуется под именем mispeech) выпустила MiDashengLM-Gen и одновременно опубликовала статью MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching (arXiv:2608.11804), поданную 12 августа 2026 года. Система состоит из дообученной языковой модели Qwen3-1.7B, аудиотокенизатора DashengTokenizer (латенты 768 измерений при 25 Гц, сжатые проектором до 5 Гц) и DiT для flow matching (16 слоёв, hidden 2048, 8 head). Инференс идёт 10-шаговым ОDE-солвером Эйлера с CFG 2.0, на выходе получается моно WAV 16 кГц длиной от 1 до 20 секунд. Описание сцены пишется структурированным текстом с тегами , , , , , , которые явно указывают, какой компонент звука генерирует каждый фрагмент. Обучение шло на приватном суперсете ACAVCaps объёмом 77 000 часов (речь, музыка, эффекты, производный от ACAV100M) и на TTS-корпусах Emilia, LibriTTS, LJSpeech, AISHELL-3, WenetSpeech4TTS.

Контекст

Новизна модели не в генеративном блоке: связка LLM с flow matching на DiT — известный рецепт. В чём она новая — это объединение синтеза речи, музыки, звуковых эффектов и акустики окружения в одной модели с раздельным управлением компонентами через теги. Авторы прямо указывают, что классический подход строится на конвейере из отдельных TTS, музыкальной и SFX-моделей со «замороженным» текстовым энкодером, который ограничивает кросс-модальную оптимизацию и разборчивость речи. MiDashengLM-Gen продолжает линейку Xiaomi: её предшественник — модель Dasheng AudioGen, а по заявлению авторов MiDashengLM-Gen стал первым открытым end-to-end генератором смешанных аудиосцен.

Почему это важно для индустрии

Компонентный стек «TTS + музыка + SFX» как самостоятельный продукт обесценивается: стоимость генерации смешанной аудиосцены падает до уровня одного открытого чекпоинта под Apache-2.0, и команды за дни собирают прототип «текст в звуковую дорожку» без внешних вендоров. Это обостряет конкуренцию в creator-tools и прототипировании интерактивных медиа. Цифры показывают масштаб шага: на бенчмарке Seed-TTS английский WER снижен до 2,79% против 12,15% у предшественника Dasheng AudioGen — улучшение примерно в 4 раза, а качество музыки и эффектов конкурентно (FAD/CLAP на MusicCaps и MECAT). При этом специализированный Qwen3-TTS выдаёт WER 1,24%, то есть в чистой разборчивости речи dedicated TTS пока вдвое впереди, и архитектура «LLM-костяк + flow matching» ещё не обошла отдельные синтезаторы.

Почему это важно для пользователей

Модель можно попробовать сразу: онлайн-демо xingws.github.io/midashenglm-gen-demo содержит примеры в 7 категориях — SFX, музыка, смешанный звук, 9 языков, эмоции, сложная фонетика. Чекпоинт mispeech/midashenglm-gen лежит на Hugging Face с quickstart на три строки (AutoModel.from_pretrained + generate), а в репозитории есть infer.py для локального запуска. Уже сегодня на её базе реалистично собрать MVP «звуковой дорожки по тексту» для коротких фрагментов до 20 секунд: джинглы, звуковые эффекты, аудиоинсерты для рекламы, прототипы гейм-сцен.

Что пока неизвестно / ограничения

Вывод — моно 16 кГц, ниже CD-качества; длина сцены ограничена примерно 20 секундами, большие клипы авторы не проверяли. Клонирования голоса в модели нет. Для русского языка модель пока не готова к производству: WER 13,19% против 2,42% на английском, и причина — состав данных: русского нет ни в одном TTS-корпусе, на котором обучалась система, а в речевом срезе ACAVCaps его доля лишь 4,66% при английском 54% и китайском 24,5%. Данные о latency, API и ценообразовании не опубликованы, production-готовность остаётся непроверенной.

Источники

Автор

Look at AI, редакция