🎧 Xiaomi открыла MiDashengLM-Gen: из текста — целая звуковая сцена
Команда Xiaomi открыла end-to-end модель: по структурированному тексту она одновременно генерирует речь, музыку, звуковые эффекты и акустическую среду. Ядро — Qwen3-1.7B и DiT flow matching, выход — моно WAV 16 кГц, 1–20 секунд.
🌍 Это первый открытый end-to-end генератор смешанных аудиосцен: одна модель заменяет конвейер из отдельных TTS, музыкальной и SFX-моделей. На Seed-TTS ошибка распознавания речи снижена с 12,15% до 2,79%, сокращая разрыв с Qwen3-TTS (1,24%).
👤 Попробовать можно сразу: демо в 7 категориях — xingws.github.io/midashenglm-gen-demo, веса — mispeech/midashenglm-gen на Hugging Face. Ограничения: 16 кГц, до ~20 секунд, нет клонирования голоса, на русском 13,19% ошибки против 2,42% на английском.
Источник 1: https://arxiv.org/abs/2608.11804 Источник 2: https://github.com/xiaomi-research/midashenglm-gen
