Лаборатория TencentARC представила SCoPE — архитектурную модификацию видеодиффузионных моделей, которая встраивает контроль движения камеры непосредственно в позиционное кодирование. Вместо отдельного контрольного модуля каждый токен видео получает луч камеры как вторую координату, что даёт модели неявное понимание 3D-пространства при добавлении менее 0,1 процента новых параметров.

image
image

Что произошло

TencentARC выпустила SCoPE (Sightline-Coordinate Positional Encoding for Video Diffusion Transformers) — метод, добавляющий управление камерой к видеодиффузионным моделям через модификацию positional encoding. Каждый токен видео получает луч камеры как вторую позиционную координату, и механизм внимания начинает сравнивать не только содержание кадров, но и геометрию взгляда. На модели Wan2.2-I2V-A14B (14 миллиардов параметров) SCoPE снижает ошибку вращения камеры на 29 процентов и метрику FVD (Frechet Video Distance) на 43 процента, добавляя менее 0,1 процента новых параметров. Модель доступна под лицензией Apache-2.0 с открытым кодом и готовыми весами объёмом около 67 ГБ.

Контекст

До SCoPE управление камерой в видеодиффузионных трансформерах (DiT) решалось через добавление отдельных контрольных модулей, что увеличивало сложность архитектуры и требовало значительных изменений в пайплайне. SCoPE предлагает принципиально иной подход: камера становится не дополнительным модулем, а частью системы координат токенов. Метод Preserve RoPE обеспечивает бит-в-бит совместимость с неизменным преобученным бэкбоном, а механизм Normalize-Gate-Inject позволяет работать как с метрическими, так и с приблизительными источниками информации о глубине, снимая проблему гетерогенных данных.

Почему это важно для индустрии

SCoPE демонстрирует обобщаемый паттерн «камера как координатная система» для любых видеодиффузионных трансформеров. Минимальный оверхед в 0,1 процента параметров и бит-в-бит совместимость через Preserve RoPE означают легкую интеграцию в существующие пайплайны без перетренировки основной модели. Механизм Normalize-Gate-Inject решает практическую проблему работы с гетерогенными источниками данных о глубине. Для продуктов на базе Hugging Face Spaces, Replicate, ComfyUI интеграция SCoPE возможна в течение дней. Лицензия Apache-2.0 открывает путь к коммерциализации.

Почему это важно для пользователей

Модель доступна для немедленного использования: можно скачать веса, загрузить один кадр и задать произвольную траекторию камеры, включая управление в стиле WASD. SCoPE поддерживает кинематографические наезды, отъезды, облёты, подъёмы краном и произвольные пути камеры. Код написан на Python, для инференса требуется GPU с поддержкой CUDA. Паттерн «один кадр плюс траектория камеры равно видео» готов к использованию как в исследовательских целях, так и в качестве основы для продуктов.

Что пока неизвестно / ограничения

Утверждения о том, что паттерн SCoPE легко переносится на любые видеодиффузионные трансформеры, не подтверждены экспериментально — работа проведена исключительно на модели Wan2.2-I2V-A14B. Отсутствие кросс-модельных экспериментов на VideoCrafter, OpenSora, CogVideoX ограничивает выводы об обобщаемости. Для production-сервисов необходимы собственные замеры латентности и стресс-тесты на реальных рабочих нагрузках.

Источники

Автор

Look at AI, редакция