В экосистеме ComfyUI продемонстрировали production-подобный workflow, разделяющий управление генеративной сценой на три независимых слоя: движение актера, виртуальную камеру и финальный визуальный стиль. Цепочка соединяет open-source модель Meta SAM 3D Body, Blender и видеомодель ByteDance Seedance 2.5: сначала обычное видео превращается в полную 3D-заготовку тела, затем в 3D-редакторе отдельно ставятся мизансцена и камера, и только после этого запускается генерация финальной сцены. В такой схеме контроль над движением и ракурсом перестает зависеть от точности текстового промпта.

image

Что произошло

Основой цепочки стал SAM 3D Body — официальный шаблон ComfyUI, доступный в Template Library и на Comfy Cloud. По обычному видео он восстанавливает полную 3D-модель человеческого тела с позой, формой и мимикой, а его пайплайн включает трекинг SAM3.1 multiplex, детекцию человека RT-DETR v4 на бэкбоне DINOv3, опциональную оценку угла обзора камеры MoGe 2 ViT-L, мимику через MediaPipe и выгрузку готового рига в формате GLB. Далее заготовка передается в Blender, где режиссер независимо от исходной съемки меняет положение виртуальной камеры, ракурс, объектив и траекторию движения. Финальную сцену собирает ByteDance Seedance 2.5 — видеомодель, запущенная 31 июля 2026 года: она выводит до 30 секунд видео за один проход с синхронным звуком и липсинком, принимая при этом до 30 референс-изображений. Подключение Seedance 2.5 к графу ComfyUI выполнено через partner nodes, то есть закрытая API-модель вызывается прямо из workflow.

Контекст

Ни один из компонентов цепочки не является новой архитектурой или новым исследовательским результатом: вся новизна — в оркестрации и в декомпозиции контроля на три независимых слоя. Раньше результат ИИ-видео определял единственный текстовый промпт, что делало постановку сложных сцен «лотереей» из повторных попыток; сценарий R2V назначает главным каналом управления детерминированную 3D-заготовку, а промпту отводит вспомогательную роль. Сама логика повторяет классическую схему подготовки 3D-производства, где дешевый previz используется для проверки мизансцены и тайминга до дорогого финального рендера. При этом механика partner nodes уже сложилась как стандартный способ подключать закрытые коммерческие модели к open-source графам ComfyUI, так что описанный workflow опирается на проверяемые публичные блоки: официальные шаблоны, документацию docs.comfy.org и бесплатный локальный запуск.

Почему это важно для индустрии

Для индустрии меняется экономика производства ИИ-видео. Стадия, на которой режиссер ставит мизансцену, выставляет камеру и проверяет тайминг, выполняется бесплатно на open-source инструментах SAM 3D Body и Blender, итерации ведутся в 3D до обращения к платной модели, а деньги расходуются только на финальные проходы Seedance 2.5. Это сдвиг от принципа «плати за каждую попытку» к модели «бесплатные итерации, плати за результат», которая впервые делает классическую previz-стадию частью ИИ-пайплайна из общедоступных блоков. Для студий и билдеров, работающих над рекламным и short-form контентом, короткие сцены до 30 секунд за проход дают рабочую проверку тайминга и камеры до дорогих генераций. Если связка приживется, конкуренция развернется за место partner-нод в подобных пайплайнах, а другим вендорам видеомоделей, вероятно, придется добавить эквивалент R2V-режима с 3D-условием.

Почему это важно для пользователей

Цепочку можно воспроизвести сразу: ComfyUI и SAM 3D Body запускаются локально и бесплатно на собственной видеокарте, Blender также бесплатен. Шаблон SAM 3D Body находится в Template Library по названию «SAM 3D Body: 3D Human Mesh Extraction From Video», тот же шаблон доступен на Comfy Cloud, а готовые конфигурации открываются по ссылкам cloud.comfy.org. Платный этап один: для Seedance 2.5 нужен аккаунт Comfy с кредитами, которые пополняются предоплатой через Stripe, и стоимость прохода показывается до запуска генерации. На практике это означает, что перебор поз, ракурсов и траекторий камеры ведется в 3D-заготовке без затрат, деньги тратятся только на финальный вариант, а текстовый промпт перестает быть единственным способом управления сценой. Реалистичный сегодня сценарий для читателя — прототипы и короткие сцены до 30 секунд, а не длительный готовый контент.

Что пока неизвестно / ограничения

В источниках не подтверждены ключевые характеристики запуска: не указаны требования к GPU для локальной работы SAM 3D Body, не измерено время полного прохода и не названа доля неудачных генераций. Оценка качества отсутствует как класс — нет метрик точности реконструкции тела, позы и мимики, нет измерений дрейфа между 3D-заготовкой и финальным видео, поэтому «production-подобность» workflow остается интерпретацией демонстрации, а не измеренным утверждением. Главное capability-утверждение — высокое соответствие финальной сцены 3D-заготовке при генерации Seedance 2.5 — требует проверки на независимых примерах. Точная цена генерации Seedance 2.5 в доступных материалах не раскрыта, и практическое применение пока разумно ограничить ролью previz, а не гарантией финального результата.

Источники

Автор

Look at AI, редакция