На конференции WAIC 2026 компания MiniMax анонсировала H3 — новое поколение мультимодальной видеомодели. Новинка ориентирована на создание высококачественного контента в разрешении 2K с продолжительностью роликов до 15 секунд, предлагая нативную интеграцию аудио и продвинутые инструменты контроля визуальной консистентности.

image

Что произошло

Компания MiniMax представила мультимодальную модель H3, которая поддерживает генерацию видео в разрешении 2K длительностью до 15 секунд. Ключевые технические особенности включают систему Omni Reference для сохранения консистентности персонажей, улучшенную работу с 2D-анимацией и встроенную генерацию аудио, включая диалоги, звуковые эффекты и липсинк.

Контекст

Разработка H3 знаменует переход от эволюционного развития архитектуры Hailuo 2.x к принципиально новому подходу, где видео, звук и физическая достоверность движений рассматриваются как единый продукт. Модель позиционируется как конкурент ведущим решениям в индустрии, таким как Kling и Veo.

Почему это важно для индустрии

Появление H3 усиливает конкуренцию в сегменте высококачественных видеомоделей, подталкивая индустрию к переходу от узкоспециализированных инструментов к комплексным мультимодальным решениям (видео + аудио + консистентность). Это может ускорить разработку новых UX-паттернов для управления персонажами и автоматизации видео-продакшна.

Почему это важно для пользователей

Для создателей контента модель позволяет генерировать более длинные и стабильные видеоролики с одними и теми же персонажами без необходимости сложной склейки фрагментов и отдельной озвучки. Встроенная работа со звуком и липсинк значительно снижают трудозатраты на постобработку.

Что пока неизвестно / ограничения

На данный момент отсутствует информация о доступности API, стоимости использования и задержках (latency), что затрудняет оценку возможности интеграции модели в реальные производственные процессы (production).

Источники

Автор

Look at AI, редакция