Команда LynnReal-AI выпустила beta 0.1 единой видеомодели LynnReal-Omni: один открытый чекпойнт закрывает генерацию по тексту и изображению, управление позами, редактирование, восстановление деградированного видео и стриминг длинных роликов — задачи, которые раньше требовали отдельной модели на каждую. Флагманская 32B-версия работает за 4 шага денойзера, облегчённая Flash-версия на 27B параметров — за 3 шага и впервые приближает открытую видеомодель к темпу реального времени на одной H100. Веса выложены на Hugging Face вместе с официальным ComfyUI-портом и готовыми воркфлоу, так что попробовать модель можно уже сегодня.

image
image

Что произошло

Команда LynnReal-AI выпустила beta 0.1 видеомодели LynnReal-Omni. Флагманский чекпойнт на 32B параметров построен как мультимодальный diffusion-трансформер по архитектуре MiniMax H3, с фрагментами Qwen3-VL в качестве энкодера условий. Одна модель закрывает t2v, i2v, управление позами тела и рук, structural control по 3D-рендерам и записям игр, omni-reference генерацию, style transfer, видео-редактирование, покадровое восстановление деградированного видео и стриминг длинных видео за 4 шага денойзера. Отдельная 27B-версия LynnReal-Omni-Flash работает за 3 шага с W8A8-квантованием и лёгким VAE-декодером: на одной H100 генерация и декодинг 22 кадров 540p занимают 843 мс у Standard и 377 мс у Flash, а 5-секундный клип 1344×768 с нативным стерео-звуком у Flash собирается примерно за 8,4 секунды. Веса выложены на Hugging Face: Standard BF16 занимает 61,7 GiB, Flash INT8 — 37,0 GiB. Релиз сопровождается официальным ComfyUI-портом с нодпаком ComfyUI-LynnReal и готовыми воркфлоу, техотчётом на arXiv (номер 2609.15863) и бенчмарком MSAVP для multi-shot аудио-визуальной генерации.

Контекст

Классический видеостек собирается из цепочки узких моделей: под каждую задачу нужен свой чекпойнт, между этапами приходится согласовывать форматы данных, а каждое звено обслуживать отдельно. LynnReal-Omni предлагает другой дизайн: единая модель напрямую принимает разнородные условия — референсы внешности, 3D-рендеры, записи игр — и работает с ними без промежуточных конвейеров. Именно такая многоусловность нужна агентным визуальным пайплайнам, где софт-агент ведёт задачу от идеи до готового ролика, не переключаясь между сервисами. Открытость весов здесь принципиальна: ключевые заявления команды, от скорости до покрытия задач, можно проверить независимо, не полагаясь на заверения вендора.

Почему это важно для индустрии

Для компаний, строящих видеопайплайны, консолидация стека в один чекпойнт означает меньше обслуживаемых сервисов, меньше согласований на стыках этапов и проще деплой. Разнородные условия агент может передавать в одну модель вместо цепочки вызовов узких сервисов — это прямой шаг к agentic visual workflows, где визуальная часть автоматизации собирается внутри единого чекпойнта. Скорость Flash-версии приближает открытую видеомодель к темпу реального времени на одной карте H100: если независимые замеры подтвердят цифры команды, стриминг видео в реальном времени перестаёт быть прерогативой закрытых систем и становится инженерной задачей для открытого стека. Официальный ComfyUI-порт переносит пайплайн из исследовательских скриптов в массовый инструмент, вокруг которого сразу формируются кастомные воркфлоу. Если бета дозреет, вероятны быстрая интеграция в ComfyUI-экосистему, квантованные версии и адаптации под меньший объём VRAM.

Почему это важно для пользователей

Попробовать модель можно в тот же день: достаточно скопировать нодпак ComfyUI-LynnReal, воркфлоу и модели из каталога comfyui/models в свою установку ComfyUI. У Standard (4 шага денойзера) есть workflows для t2v, i2v, r2v, pose2v и v2v, у Flash (3 шага) — для t2v, ti2v и ref2v. Жёсткий барьер — железо: релиз тестировался на H100 80GB и RTX 4090 48GB, обычных 24 ГБ VRAM не хватит. Дальше начинаются бета-шероховатости: Flash-путь в ComfyUI пока не работает с клипами длиннее 11 секунд, сам порт экспериментальный и медленнее оригинальных скриптов, а репозиторий остаётся ранней бетой с известными ограничениями.

Что пока неизвестно / ограничения

Заявленные тайминги — точечный замер команды: открытые веса делают цифры воспроизводимыми, но экстраполяция на стриминг длинных видео требует доказательств консистентности на длинных последовательностях. Бенчмарк MSAVP представлен той же командой, что выпустила модель, а методология, бейзлайны и протоколы сравнения не раскрыты, поэтому качественные сравнения с другими моделями до внешнего аудита следует считать self-eval и строить оценку качества на собственных тестах. Это ранняя beta 0.1: при текущем темпе развития поля конкретные цифры версии быстро устареют, а независимые верификации и реакция конкурентов пока не состоялись.

Источники

Автор

Look at AI, редакция