Команда исследователей Chen, Wang, Mu, Yang, Chng представила VocalRender — систему синтеза вокала, которая генерирует вокальное исполнение напрямую из нотной записи: MIDI-партии, текстовых слогов и темпа. Модель устраняет главное узкое место современных SVS-систем — необходимость явного предсказания длительностей фонем и F0-кривых, — и делает рабочий процесс композиторов совместимым с генерацией вокала. Веса и код открыты под лицензией Apache-2.0.

image
image
image

Что произошло

VocalRender принимает на вход три параметра: MIDI-pitch (ноты), текстовые слоги и BPM — и самостоятельно определяет артикуляцию и тайминг. Архитектура построена на базе VoxCPM2 от OpenBMB и включает три ключевых компонента: interleaved lyric-note токенизация, AudioVAE для непрерывных акустических латентов и autoregressive diffusion model (ARDM) для генерации. Выпущены два чекпоинта — VocalRender (обучен на CrawlSinger-OS, более 2300 часов вокала) и VocalRender-Pro (более 5600 часов, 160 тысяч шагов обучения). Каждый весит около 9,5 ГБ и выдаёт аудио 48 kHz WAV. Для задания тембра требуется prompt-аудио — отрезок чистого вокала длительностью 2–8 секунд. Статья опубликована на arXiv 30 июля 2026 года (2607.27768).

Контекст

До появления score-native подходов SVS-системы — SoulX-Singer, TCSinger, TechSinger, Vevo2 — требовали явного предсказания длительностей фонем и времени-выровненных акустических референсов. Это создавало промежуточный этап между нотной записью и генерацией, который не совпадал с реальным рабочим процессом композиторов, работающих в MIDI-окружении. Interleaved lyric-note токенизация VocalRender решает нетривиальную задачу музыкальной токенизации: она поддерживает мелизмы, когда один слог распределяется на несколько нот. Гибридная комбинация автогрессивной модели с диффузией (ARDM) объединяет эффективность автогрессивной генерации с качеством диффузионных моделей. Использование VoxCPM2 как фундамента позволяет модели наследовать предобученные TTS-представления, сокращая объём данных, необходимый для SVS-специализации.

Почему это важно для индустрии

VocalRender превосходит лучшие бейзлайны на 0,42 балла по метрике CMOS (естественность звучания) и достигает WER 3,88% на бенчмарке Opencpop. Score-native архитектура устраняет необходимость промежуточных пайплайнов, что делает систему совместимой с рабочим процессом композиторов и открывает путь к интеграции в DAW-среды. Текущие SVS-продукты, строившиеся на проприетарных пайплайнах с предсказанием длительностей, теряют часть технического преимущества. Открытые веса и Apache-2.0 лицензия позволяют стартапам и исследователям использовать модель как базовый слой. Архитектура VoxCPM2 изначально мультиязычная, что оставляет путь к расширению поддержки языков через дообучение сообществом.

Почему это важно для пользователей

Модель доступна для тестирования прямо сейчас: демо на HuggingFace позволяет загрузить короткий вокальный отрезок и MIDI-партию с текстом и получить результат. Код и веса открыты на GitHub, модель можно запустить локально на GPU. Для русскоязычного сообщества пока доступен только мандаринский китайский, но prompt-аудио подход и архитектура VoxCPM2 оставляют возможность дообучения на других языках. Разработчики могут начать интеграцию VocalRender в прототипы DAW-плагинов, voice-cloning сервисов и музыкальных AI-инструментов.

Что пока неизвестно / ограничения

Только мандаринский китайский — мультиязычная поддержка пока не реализована. Нет публичных данных о latency инференса: ARDM-генерация 48 kHz аудио требует значительных вычислительных ресурсов. Отсутствуют инструкции по fine-tuning. Нет serving-оптимизаций для production deployment — TensorRT-ускорение, квантование и аналогичные оптимизации не заявлены. Качество на русскоязычном вокале не проверялось.

Источники

Автор

Look at AI, редакция