Открытые веса MiniMax H3 за две недели обросли рабочей инфраструктурой: в ComfyUI появились ноды для чанковой генерации длинных роликов, склейки клипов с per-clip LoRA и апскейла до 2560×1440, а само видеоускорение пошло двумя независимыми путями — дистиллированный FastH3 с 4 шагами вместо 49 и 90% разреженного VSA-внимания и двухстадийный Sol-Engine от NVIDIA с дешёвым черновиком и лёгким рефайном. Авторы заявляют ускорение 14–28× на датацентровых GPU, но на потребительских картах генерация остаётся офлайн-процессом, который измеряется десятками минут на клип. Разбираем, что именно вышло, что это значит для себестоимости секунды видео и где проходят границы известных фактов.
Что произошло
27 августа команда FastVideo (Hao AI Lab @ UCSD, Nuva Lab, NVIDIA FastGen) выпустила FastH3 Preview v1: открытые веса дистиллированной MiniMax H3 на HuggingFace с 4 шагами сэмплирования вместо 49 и 90% разреженным VSA-вниманием; по замерам авторов, 15-секундное видео в 768p генерируется менее чем за 13 секунд на 8×B200, а ускорение на одной B200 достигает 14,38×. Команда NVIDIA SANA показала Sol-Engine: 4-шаговый черновик 896×512 на H3+LoRA, за которым следует 3-шаговый LTX-рефайн с Sol-Attn; на одном GB200 5-секундное видео с разрешением 1344×768 генерируется за 6,852 с (22,2× к SGLang), 10-секундное — за 14,931 с (27,7×). Параллельно вокруг модели вырос слой ComfyUI-нод: hradec/ComfyUI-HR-Endless-Sampler (73 звезды, создан 17 августа) сэмплирует видео произвольной длины чанками с латентной непрерывностью и живым превью, планируя и переписывая промпты каждого чанка через Gemma4 12B QAT; tritant/ComfyUI_MiniMax_H3_Extender в версии 2.0 (177 звёзд, обновлён 1 сентября) склеивает клипы с поддержкой FL2VA и пер-клиповых LoRA; dntpi/ComfyUI-Hand-Tie-Clips предлагает новый клип-чейнер; lisitskyaa/ComfyUI_UltimateSDUpscaleGuider_H3 генерирует 1504×832 с апскейлом до 2560×1440.
Контекст
До открытия весов MiniMax H3 — генеративная модель видео плюс аудио — была фактически доступна через разработческий API по цене $0,08 за секунду 768p. Открытые веса сменили режим доступа: модель теперь можно пост-тренить на собственной инфраструктуре, и на видео были перенесены два проверенных паттерна ускорения. Первый — дистилляция шагов: FastH3 сокращает базовый 49-шаговый цикл сэмплирования до 4 шагов и использует 90% разреженное VSA-внимание. Второй — двухстадийная схема от NVIDIA: дешёвый черновик в низком разрешении уточняется лёгким LTX-рефайном с Sol-Attn. Вторая часть контекста — железо: хедлайн-цифры получены на датацентровых B200 и GB200, тогда как локальные ComfyUI-воркфлоу живут на потребительских картах с 16 ГБ памяти, где речь идёт об офлайн-производстве, а не об интерактивной генерации.
Почему это важно для индустрии
Для билдеров главный сдвиг в том, что MiniMax H3 перестала быть просто API: открытые веса сделали её платформой для пост-тренинга, где ценность создаётся слоем оркестрации и ускорения — дистилляцией, разреженным вниманием, схемами draft+refine и per-clip адаптерами. Два независимых стека, FastH3 и Sol-Engine, заявляют ускорение более чем на порядок на том же железе; относительно базового 49-шагового сценария это кратно снижает себестоимость секунды генерации на собственном железе, а ценовой зонтик закрытых API оказывается под давлением. При сохранении темпа вероятна вторая волна дистиллятов и независимых воспроизведений, которые либо подтвердят, либо скорректируют текущие цифры, а LoRA-адаптеры, разреженные attention-бэкенды и двухстадийные рефайны могут стать стандартными компонентами открытых видео-моделей — по сценарию, по которому вызревали открытые LLM-стеки. Ожидаем и рынок упакованных решений поверх таких нод: нормальный UX, менеджеры совместимости и пресеты воркфлоу.
Почему это важно для пользователей
Если вы делаете видео в ComfyUI, MVP-пайплайн «сценарий — длинный ролик — 1440p» собирается из готовых нод уже сегодня: Endless-Sampler от hradec для чанковой генерации клипов произвольной длины с латентной непрерывностью (ему нужен Gemma4 12B QAT для переписывания промптов чанков), Extender 2.0 от tritant для склейки клипов с per-clip LoRA и поддержкой FL2VA, UltimateSDUpscaleGuider от lisitskyaa для апскейла 1504×832 до 2560×1440. Веса FastH3 с готовыми LoRA-адаптерами уже можно скачать с HuggingFace, но для их работы требуется VSA-бэкенд от FastVideo — dense-attention не подойдёт. Ожидания на 16-гигабайтной карте стоит снижать: по замеру автора ноды на RTX 4080 Super 10-секундный клип занимает 18 минут генерации плюс 38 минут апскейла, так что пока это batch-производство и прототипы, а не интерактив. Держите в голове и совместимость: часть старых воркфлоу под Extender 2.0 требует замены нод, а чанковый сэмплер может конфликтовать с быстрым VAE от Kijai.
Что пока неизвестно / ограничения
Ключевые цифры — ускорение 14–28×, менее 13 секунд на 15-секундное видео 768p на 8×B200, 6,852 с и 14,931 с на GB200 — являются замерами самих авторов и пока не имеют независимой репликации. Опубликованных метрик качества дистиллированного FastH3 тоже нет, а дистилляция шагов почти всегда идёт с quality trade-off, поэтому без его оценки говорить о равноценном результате «на том же железе» рано. Хедлайн-показатели получены на датацентровых GPU, так что их перенос на потребительские карты и вывод о лавинообразном обрушении себестоимости API-секунды остаются интерпретацией, а не установленным фактом. Наконец, замер на RTX 4080 Super сделан автором ноды на одной конфигурации, а совместимость нод между собой — VSA-бэкенд, замена нод в старых воркфлоу, возможный конфликт с быстрым VAE от Kijai — проверяется на каждом сетапе отдельно.
Источники
- FastVideo FastH3 Preview v1: Open-Weight 4-Step Sparse Distilled MiniMax H3 — Hao AI Lab @ UCSD
- MiniMax H3 Super Acceleration — NVIDIA SANA Sol-Engine
- tritant/ComfyUI_MiniMax_H3_Extender — репозиторий на GitHub (v2.0)
Автор
Look at AI, редакция