Китайская компания MiniMax открыла веса модели MiniMax Music 3 — генератора полных музыкальных треков до 5 минут с текстом, вокалом и аранжировкой. Архитектура гибридная: 8B Global LLM на базе Qwen3-8B для структуры и 0.6B Local LLM для акустических деталей. Синтез через Flow Matching (2.4B) + Flow-VAE (123M). Инференс на двух GPU: 24 ГБ VRAM стандартно, 8 ГБ со стримингом. Токенизация — 8-слойный RVQ. Распространяется по Apache 2.0.


Что произошло
13 августа 2026 года MiniMax опубликовала MiniMax Music 3 с открытыми весами. Модель генерирует полные треки до 5 минут с управляемой структурой, вокалом и аранжировкой. Вход — текст песни с тегами секций ([Verse], [Chorus] и др.) и детальное описание музыки через Structured Caption. Интеграции доступны в diffusers, ComfyUI и SGLang-Omni. Официальный API на platform.minimax.io.
Контекст
MiniMax продолжает стратегию открытых весов (после H3) в сегменте генерации музыки, где ранее доминировали закрытые решения вроде Suno и Udio. Архитектурный паттерн Global + Local LLM с Flow Matching — современный подход к генерации аудио. Токенизация через 8-слойный RVQ с семантическим кодбуком 16384 + 7 акустических слоев по 1024 обеспечивает иерархическое представление аудио.
Почему это важно для индустрии
Модель поднимает планку open-source генерации музыки до уровня закрытых Suno и Udio при минимальных требованиях к железу (8 ГБ VRAM) и лицензии Apache 2.0. Это делает музыку-as-a-feature практически бесплатной для стартапов. Интеграции с ComfyUI и diffusers означают, что разработчики начнут эксперименты в первую неделю. SGLang-Omni добавит оптимизации batch-inference.
Почему это важно для пользователей
Можно запустить локально на GPU с 8+ ГБ VRAM или использовать через ComfyUI для интеграции в рабочие процессы. API на platform.minimax.io позволяет генерировать музыку по API. Инструмент music-caption-rewriter автоматически превращает простые описания в профессиональные промпты. Структурированный контроль (теги секций, BPM, жанр) дает UX-основу для приложений.
Что пока неизвестно / ограничения
Ни один peer не указал объективные метрики качества (MOS, FAD, PESQ, Clarity Score) или сравнение в head-to-head бенчмарках с Suno и Udio. Заявка production-ready требует эмпирического подтверждения. Главный вопрос для продакшн — реальный latency генерации 5-минутного трека и стабильность на долгосрочных генерациях.
Источники
- MiniMax Music 3.0: Next-Generation Open-Weights, Production-Ready & Versatile Music Model
- MiniMax-AI/MiniMax-Music3 — GitHub
- MiniMaxAI/MiniMax-Music3 — Hugging Face
Автор
Look at AI, редакция
