Представлена стратегия обучения Self Gradient Forcing (SGF), предназначенная для решения проблемы разрыва градиента исторического контекста в авторегрессионных видеодиффузионных моделях.



Что произошло
Метод SGF использует двухпроходную схему обучения: первый проход выполняет безградиентный проход (rollout), а второй — параллельную реконструкцию градиентов контекста (KV-кэша). Это позволяет оптимизировать процесс записи информации в память, обеспечивая возможность экстраполяции видео с 5-секундного обучающего окна до нескольких минут с высокой стабильностью персонажей и фона.
Контекст
В классических методах Self Forcing исторический KV-кэш является «замороженным» состоянием, что создает фундаментальный недостаток — разрыв градиента. Это ограничивает способность моделей эффективно обучаться управлению памятью при генерации длинных последовательностей.
Почему это важно для индустрии
SGF устраняет необходимость в катастрофических вычислительных затратах на обратное распространение ошибки через всю длинную последовательность. Технология может быть интегрирована в текущие пайплайны обучения видео-SOTA моделей и потенциально станет стандартом при обучении авторегрессионных моделей для работы с длинными последовательностями (видео/аудио).
Почему это важно для пользователей
Для пользователей это означает появление нейросетей, способных генерировать качественные, последовательные и длинные видеоролики (длительностью в несколько минут) без искажения лиц героев и изменения окружения, при этом требуя меньших вычислительных ресурсов для обучения.
Источники
- Self Gradient Forcing: Native Long Video Extrapolation (Project Page)
- [arXiv:2607.20368 [cs.CV] Self Gradient Forcing: Native Long Video Extrapolation](https://arxiv.org/abs/2607.20368)
Автор
Look at AI, редакция
