Китайская компания MiniMax открыла веса модели MiniMax Music 3 — генератора полных музыкальных треков до 5 минут с текстом, вокалом и аранжировкой. Архитектура гибридная: 8B Global LLM на базе Qwen3-8B для структуры и 0.6B Local LLM для акустических деталей. Синтез через Flow Matching (2.4B) + Flow-VAE (123M). Инференс на двух GPU: 24 ГБ VRAM стандартно, 8 ГБ со стримингом. Токенизация — 8-слойный RVQ. Распространяется по Apache 2.0.

image
image
image

Что произошло

13 августа 2026 года MiniMax опубликовала MiniMax Music 3 с открытыми весами. Модель генерирует полные треки до 5 минут с управляемой структурой, вокалом и аранжировкой. Вход — текст песни с тегами секций ([Verse], [Chorus] и др.) и детальное описание музыки через Structured Caption. Интеграции доступны в diffusers, ComfyUI и SGLang-Omni. Официальный API на platform.minimax.io.

Контекст

MiniMax продолжает стратегию открытых весов (после H3) в сегменте генерации музыки, где ранее доминировали закрытые решения вроде Suno и Udio. Архитектурный паттерн Global + Local LLM с Flow Matching — современный подход к генерации аудио. Токенизация через 8-слойный RVQ с семантическим кодбуком 16384 + 7 акустических слоев по 1024 обеспечивает иерархическое представление аудио.

Почему это важно для индустрии

Модель поднимает планку open-source генерации музыки до уровня закрытых Suno и Udio при минимальных требованиях к железу (8 ГБ VRAM) и лицензии Apache 2.0. Это делает музыку-as-a-feature практически бесплатной для стартапов. Интеграции с ComfyUI и diffusers означают, что разработчики начнут эксперименты в первую неделю. SGLang-Omni добавит оптимизации batch-inference.

Почему это важно для пользователей

Можно запустить локально на GPU с 8+ ГБ VRAM или использовать через ComfyUI для интеграции в рабочие процессы. API на platform.minimax.io позволяет генерировать музыку по API. Инструмент music-caption-rewriter автоматически превращает простые описания в профессиональные промпты. Структурированный контроль (теги секций, BPM, жанр) дает UX-основу для приложений.

Что пока неизвестно / ограничения

Ни один peer не указал объективные метрики качества (MOS, FAD, PESQ, Clarity Score) или сравнение в head-to-head бенчмарках с Suno и Udio. Заявка production-ready требует эмпирического подтверждения. Главный вопрос для продакшн — реальный latency генерации 5-минутного трека и стабильность на долгосрочных генерациях.

Источники

Автор

Look at AI, редакция