drozbay опубликовал MaskVidExperiments, открытый пакет нод ComfyUI под лицензией GPL-3.0 для видео-инпейнтинга. Ключевые идеи пакета: стабильный кроп вокруг движущегося объекта, планируемый на весь клип целиком, и перевод масок в латентное пространство модели через её VAE с пониманием чанкованных VAE моделей MiniMax H3 и LTX-2, включая аудио-латент.

image
image

Что произошло

В GitHub появился репозиторий drozbay/MaskVidExperiments. Пакет включает ноды Subject Crop с режимами combined, tracked и zoomed для построения стабильного кропа вокруг движущегося объекта на весь клип, Subject Uncrop для возврата результата инпейнтинга в исходный кадр с мягкой кромкой, Mask Cleanup для удаления шумов и мерцаний из видеомаски, Mask To Latent Space для перевода пиксельной маски в латентное разрешение через VAE, Audio Mask To Latent для регенерации выбранных временных отрезков аудио-латента, а также мягкий вариант Differential Diffusion (Soft). Требование к окружению — ComfyUI v0.15.0 или новее, установка выполняется одной командой git clone в папку custom_nodes без сторонних зависимостей. Репозиторий создан 28 июля 2026 года, последний коммит датирован 17 августа 2026 года, на момент публикации новости у проекта 118 звёзд и 15 форков. В README приведён пример замены машины на овчарку в видео, сгенерированном LTX.

Контекст

Чтобы оценить ценность пакета, нужно посмотреть на классический workflow видео-инпейнтинга в ComfyUI: оператор выделяет область вокруг движущегося объекта, кропит её, прогоняет через видео-диффузионную модель и вставляет результат обратно в кадр. Наивный пофайловый кроп дрожит по позиции и размеру из кадра в кадр, а видео-диффузионные модели интерпретируют этот джиттер как движение камеры, что ухудшает генерацию. Вторая классическая проблема — видимые швы по границе вставленного региона. Третья, более новая, проблема в том, что современные аудио-видео модели вроде MiniMax H3 и LTX-2 используют чанкованные VAE со своим frame cycle и 2x2 token grid, а их латент может включать аудио; большинство существующих видео-инпейнт workflow эту структуру пока не обрабатывают. При этом точный перевод маски в разрешение, в котором работает модель, даётся через пространственно-временное сжатие VAE, тогда как наивный трилинейный resize размывает границу инпейнт-региона.

Почему это важно для индустрии

Для отрасли сигнал в том, что базовая инфраструктура видео-инпейнтинга превращается в коммодити: стабильный клип-уровневый кроп и точный перевод масок в латентное пространство решаются на уровне бесплатного пакета нод, а не проприетарных пайплайнов. Сильнейшая техническая деталь — готовая поддержка структуры чанкованных VAE моделей MiniMax H3 и LTX-2, закрывающая интеграционный пробел, который большинство существующих workflow ещё не заполнили. Для продуктовых команд пакет служит референс-реализацией паттерна клип-уровневого стабильного кропа в связке с латентными масками, его можно использовать как основу собственных решений и как шаблон переноса на другие модели. Прямых бизнес-событий нет: изменений ценообразования и дистрибуции не произошло, на инфраструктуру serving и стоимость инференса базовых моделей влияния нет. Если паттерн закрепится в экосистеме, в перспективе функциональность, скорее всего, будет поглощена ядром ComfyUI или официальными пайплайнами самих моделей, а долгая ценность пакета сохранится как референса.

Почему это важно для пользователей

Для тех, кто делает видео-инпейнтинг в ComfyUI, пакет бьёт сразу по двум классическим болям: дёргающемуся кропу вокруг движущегося объекта и видимым швам при возвращении результата в кадр. Ручная пофайловая ретушь области кропа перестаёт быть необходимой, а ноды встраиваются в существующий workflow без изменения остального пайплайна. По факту получается готовый конвейер для локального инпейнтинга под новые аудио-видео модели MiniMax H3 и LTX-2, включая регенерацию выбранных временных отрезков со звуком, без каких-либо платных сервисов.

Что пока неизвестно / ограничения

База доказательств пакета типична для open-source инструмента, а не для research-артефакта: README, скриншот графа workflow и один пример без количественных метрик, абляций и сравнения с альтернативными пайплайнами. Формулировки о пиксельно точной вставке и об отсутствии видимых швов являются утверждениями автора, а не измерениями: численных данных о позиционном смещении кропа и качестве швов по границе нет. Репозиторию около месяца, 118 звёзд за четыре недели — позитивный сигнал, но ещё не доказательство устойчивой поддержки и широкого внедрения.

Источники

Автор

Look at AI, редакция