Qwen Business Unit Alibaba совместно со ShanghaiTech University, HKUST, Institute of Computing Technology и Southeast University опубликовали фреймворк AVA-Encoder: он переводит готовый фильм в текстовый Film Knowledge Graph и восстанавливает видео из этого графа, а разница реконструкции служит сигналом обучения энкодера. На момент публикации работа существует в виде статьи и проектной страницы, исполняемого кода пока нет.


Что произошло
Статья AVA-Encoder: Towards Agent-Native Video Representation Learning (arXiv:2608.12313) подана на arXiv 12 августа 2026 года, 18 августа вышла версия 2. Система сжимает фильм в текстовый граф знаний с иерархией Story–Event–Shot и типизированными узлами персонажей, сцен, объектов, стиля, камеры и аудио, затем восстанавливает видео из графа фиксированным декодером. Разница реконструкции служит сигналом оптимизации двухцикловой схемы: внешний цикл обучает политику энкодера для режимов shot и keyframe до деплоя, опциональный внутренний цикл дорабатывает граф конкретного видео во время инференса. В бенчмарке AVA-Encoder набирает 49.0% общей фидельности реконструкции против 28.3% у сильнейшего внешнего бейслайна soap2soap, это плюс 20.7 процентных пункта, или 73.1% в относительном выражении.
Контекст
У видеоагентов есть структурный разрыв: для планирования создания нового контента им нужны структурированные представления готовых фильмов, однако такого слоя между исходным видео и генерацией до сих пор не существовало, и не было объективного способа измерить, сколько информации о фильме на самом деле сохраняет текстовое описание. Научное ядро работы — самообучающийся цикл, в котором политика энкодера обучается на сигнале реконструкции до деплоя и при необходимости дорабатывается для конкретного видео во время инференса, без обновления весов foundation-моделей. На этом фоне схема видео, граф, видео предлагается как новый продуктовый примитив рынка видеоагентов: граф становится структурированным промежуточным представлением, которое агенты могут читать и передавать друг другу.
Почему это важно для индустрии
Главный вклад работы для отрасли — методология оценки, а не качество генерации: фиксированный декодер и разница реконструкции работают как интринсивная метрика того, сколько кинематографической информации сохранило представление, а автоматические метрики валидированы слепой оценкой двух экспертов — совпадение в 710 из 730 сравнений, 97.3%. Псевдообученная политика даёт небольшой выигрыш в 1.4 процентного пункта над ручной настройкой промптов (45.8% против 44.4%), зато экономия 74.3% токенов system-prompt в режиме shot и 70.1% в режиме keyframe практически значима для агентных пайплайнов. Авторы также анонсируют выпуск Film KG Dataset — структурированные тексты по десяткам тысяч шотов, первый датасет такого рода для обучения и оценки агентного видеосоздания, который при фактическом релизе может стать стандартным тренировочным набором и бенчмарком направления.
Почему это важно для пользователей
Для читателя интересен конкретный механизм видео, редактируемый граф, видео: граф знаний фильма можно семантически редактировать — сменить персонажа, стиль или освещение — и зависимые элементы сцены обновляются по связям графа, а полученный граф можно использовать как вход для других видеоагентов. На текущий момент ценность работы для читателя концептуальная: схему стоит изучить по статье на arXiv и проектной странице, она пригодится как blueprint для продуктов на стыке видео и агентов, но применять результат напрямую пока нельзя.
Что пока неизвестно / ограничения
Несколько ключевых пунктов пока не подтверждены. В GitHub-репозитории HBDYW/AVA-Encoder на момент проверки есть только сайт проекта (16 коммитов, 8 звёзд): инструменты, системные промпты и код помечены как доступные, но фактически в репозиторий не легли, поэтому систему нельзя воспроизвести, запустить или интегрировать, API и ценообразования нет. Абсолютный результат в 49.0% фидельности реконструкции означает, что при сжатии фильма в текстовый граф теряется большая часть информации, а относительный прирост посчитан лишь к сильнейшему из указанных внешних бейслайнов soap2soap, так что набор бейслайнов ограничен. Выдадут ли Film KG Dataset и код фактически, пока неизвестно.
Источники
- AVA-Encoder: Towards Agent-Native Video Representation Learning (arXiv:2608.12313)
- Проектная страница AVA-Encoder
- Официальный репозиторий HBDYW/AVA-Encoder на GitHub
Автор
Look at AI, редакция
