Исследователи Zhejiang University опубликовали работу Beyond Pixels (arXiv 2608.10744), описывающую метод Latent-to-4D, который генерирует динамические 4D-сцены напрямую из латентного пространства видео-диффузионных моделей, минуя классическую каскадную цепочку через RGB-пиксели. Метод превзошёл лучшие каскадные подходы на двух бенчмарках и получил большинство голосов в оценке людьми, однако код и веса модели пока не выпущены.


Что произошло
11 августа 2026 года группа ReLER/CCAI из Zhejiang University опубликовала на arXiv метод Latent-to-4D, который выравнивает финальные латенты видео-DiT на токенной сетке предобученного 4D-декодера и уточняет их с помощью кадрового и глобального spatiotemporal attention. Модель обучена на примерно 1000 клипах и работает с несколькими совместимыми видео-DiT из одного семейства VAE без переобучения. На бенчмарках Text4D-200 и I4D-200 метод превзошёл каскад Wan+4RC на 2,88–5,81 пункта DINO-F1 и получил 66,8–72,1% предпочтения в оценке людьми по качеству геометрии и временной стабильности. Поддерживаются режимы Text-to-4D, Image-to-4D, Audio-driven 4D, Video-as-prompt 4D, Pose-controlled и Motion-controlled.
Контекст
До появления Latent-to-4D генерация 4D-сцен строилась по каскадному принципу: сначала видео-генератор создавал последовательность кадров в RGB, затем отдельный модуль восстанавливал из них 3D-геометрию с временной компонентой. Такой пайплайн накапливает ошибки на каждом этапе и страдает от несоответствия распределений между генератором видео и реконструктором 3D. Латентное пространство видео-диффузионных моделей содержит структурированную информацию о геометрии и движении, и идея Latent-to-4D заключается в том, что эта структура может быть использована напрямую, без потерь, возникающих при промежуточном декодировании в пиксели.
Почему это важно для индустрии
Обход RGB-декодирования устраняет накопление ошибок и несоответствие распределений в каскадных пайплайнах 4D-генерации. Единый интерфейс латентов позволяет переносить одну обученную модель на несколько видео-генераторов без переобучения — это фундаментальный сдвиг от жёсткой привязки к конкретной архитектуре к модульному подходу. Для команд, разрабатывающих каскадные пайплайны, возникает риск устаревания текущих архитектур. Ожидается, что при публикации кода и весов метод быстро станет базовой линией для 4D-генерации, а латентное выравнивание как приём распространится на смежные задачи маппинга между генеративными моделями и структурными представлениями.
Почему это важно для пользователей
Бумага только опубликована, и веса и код пока не выпущены. Репозиторий hayd-zju/Beyond-Pixels на GitHub набрал 75 звёзд, работа занимает первое место в HuggingFace Daily Papers. Проект-страница содержит интерактивные демо всех 81 кадра генерации — оценить качество 4D-сцен можно прямо сейчас, без загрузки моделей. Для исследователей и разработчиков это сигнал начать проектировать интеграционные прототипы и API-контракты под будущую интеграцию латентного подхода в свои пайплайны.
Что пока неизвестно / ограничения
Код и веса модели не опубликованы, воспроизвести результаты и оценить latency невозможно. Метод протестирован только с видео-DiT из одного семейства VAE — совместимость с другими архитектурами не проверена. Метрики вычислительной стоимости, потребления памяти и времени инференса в работе отсутствуют. Бенчмарки Text4D-200 и I4D-200 ограничены по масштабу — результаты на более крупных наборах данных могут отличаться.
Источники
- Beyond Pixels: From Video Priors to 4D Worlds — arXiv 2608.10744
- Beyond Pixels: From Video Priors to 4D Worlds — Project Page
- hayd-zju/Beyond-Pixels — GitHub
Автор
Look at AI, редакция
