4 сентября NVIDIA опубликовала аудированные замеры движка Sol-H3: 5-секундное видео MiniMax-H3 в разрешении 1344x768 при 24 FPS генерируется за медиану 1.653 секунды на одной 8-карточной системе NVIDIA B300 — это 4 прохода DiT вместо 50 у базовой модели и ускорение до 15.05x по латентности. Одновременно сообщество выложило под H3 набор рабочих инструментов для ComfyUI: замену персонажа в видео, ускоренный face-refine для групповых сцен, мульти-LoRA стек-лоадер и 6-шаговый турбо-мерж.

Что произошло
NVIDIA Research выпустила материал Sol-H3 («Speed-of-Light MiniMax-H3 on an 8× NVIDIA B300 Blackwell System») с аудированным бенчмарком инференса: 5-секундный T2VA-клип MiniMax-H3 с параметрами 1344x768 и 24 FPS укладывается в медиану 1.653 секунды на одном 8-карточном ноде NVIDIA B300. Экономия собрана из нескольких приемов сразу: sparse attention с динамическими, зависящими от query порогами, фузинг ядер RMSNorm и SwiGLU, INT8-квантование QKV, FP8-транспорт и all-to-all Ulysses; число проходов DiT сжато с 50 до 4. В ту же волну легли community-релизы: ноды ComfyUI-Viggle-Animate-H3 для замены персонажа в видео — это файнтюн ref2va-трансформера H3 на 33.1B параметров с DMD2-дистилляцией и рабочим диапазоном 4-8 шагов; ComfyUI-H3-FaceRefine-Accelerated для групповых сцен (до 9 лиц в атласе, бенчмарк 995.5 секунды против 202.1 секунды, 4.925x на RTX 4090); мульти-LoRA стек-лоадер, чинящий ошибки AdaLN и квантованных сличений, из-за которых ломались LoRA для H3; 6-шаговый flat-мерж турбо-LoRA (lightxv, larryvrh плюс фотореализм JonXL); Windows-контроллер, собирающий H3-промпты из сюжета и 1-9 референсов для батч-генерации.
Контекст
MiniMax H3 — крупная видео-модель, которая генерирует клип сразу с нативным аудио, и до недавнего времени ее применение упиралось в две вещи: цену инференса и тонкий слой инструментов. Видео-DiT по устройству требует многих последовательных шагов на большом трансформере, поэтому любое сокращение числа проходов или объема вычислений внимания напрямую конвертируется в секунды и деньги. Sol-H3 интересен тем, что раскладывает экономию по слоям: менее плотное внимание, меньше обращений к памяти за счет фузинга, меньше трафика между картами за счет квантования и меньше шагов за счет DMD2-дистилляции — без замены архитектуры модели. Вторая половина события относится к экосистеме: сообщество вокруг H3 до этого находилось в стадии «скачали модель», а перечисленные релизы закрывают именно те места, где воркфлоу ломался на практике — замену персонажа, стабильность мульти-LoRA и скорость обработки лиц.
Почему это важно для индустрии
Для индустрии это аудированный ориентир себестоимости: формула «5 секунд видео с аудио менее чем за 2 секунды на одном 8-GPU ноде» становится точкой отсчета, по которой будут сверять остальные видеостеки. Ключевое здесь не сама цифра, а ее происхождение: ускорение собрано из переносимых приемов — sparse attention, квантованный транспорт, фузинг ядер, дистилляция до 4-8 шагов — то есть это воспроизводимый инженерный рецепт для других видео-DiT, а не уникальное свойство одной модели. Для команд с нодами 8× B300 резко дешевеют интерактивные эксперименты и прототипы, а для стартапов это сигнал, что себестоимость клипа скоро будут считать так же, как стоимость токенов в тексте. Отдельный сигнал — зрелость экосистемы: вокруг H3 уже сложился слой рабочих конвейеров (замена персонажа, батч по сценарию, стабильный мульти-LoRA), и именно он превращает открытую модель в продукт; в ближайшие месяцы стоит ожидать репродукций Sol-H3 и переноса этих оптимизаций на другие видео-модели.
Почему это важно для пользователей
Тем, кто уже крутит MiniMax H3 в ComfyUI, доступны конкретные шаги: клонировать ноды Viggle-Animate (int8-версия весит 21 GB, 6 шагов считаются оптимумом скорости и качества), поставить ускоренный FaceRefine для групповых сцен, подключить мульти-LoRA стек-лоадер, если LoRA падают с ошибками AdaLN или квантованных сличений, взять 6-шаговый flat-мерж турбо-LoRA для быстрой генерации и связать все Windows-контроллером, который собирает промпты из сюжета и референсов. Показательно, что ускорение face-refine замерено на RTX 4090 — такие оптимизации доходят до потребительских карт, а не остаются на дата-центровом B300. Тем, кто H3 не трогает, история полезна как наглядный разбор устройства скорости: 15x на одной модели складывается из attention-оптимизаций и квантования, а демо Sol-H3 можно посмотреть на странице NVIDIA Research.
Что пока неизвестно / ограничения
Цифра 15.05x — это латентность одной конфигурации (5-секундный клип 1344x768 при 24 FPS) на одном 8-карточном ноде B300, а не универсальное ускорение MiniMax H3: на другом железе, другой длительности или разрешении результат будет иным. В самих источниках есть мелкое разночтение: в тексте канала указано до 15.5x, в аудированном замере — 15.05x; порядок ускорения совпадает, но точное значение стоит брать из материала NVIDIA. Это демонстрация на флагманском Blackwell-железе, независимых воспроизведений Sol-H3 и замеров на других GPU пока нет. Community-инструменты тоже требуют оговорок: «оптимум 6 шагов» для Viggle-Animate — наблюдение сообщества, а не официальная рекомендация, а турбо-мержи и файнтюны могут менять поведение базовой модели, поэтому качество стоит проверять на своих задачах.
Источники
- Sol-H3: Speed-of-Light MiniMax-H3 on an 8× NVIDIA B300 Blackwell System | NVIDIA Research
- GitHub - Saganaki22/ComfyUI-Viggle-Animate-H3: ComfyUI nodes for Viggle-Animate minimax H3 finetune
- GitHub - PullMyBoots/ComfyUI-H3-FaceRefine-Accelerated: Accelerated MiniMax H3 face refinement for ComfyUI
Автор
Look at AI, редакция
