🤖 Veda от ByteDance, HKU и USTC: видеодиффузия в 5 раз быстрее

ByteDance, HKU и USTC открыли код Veda — разреженного внимания для видеодиффузионных трансформеров (ICML 2026, MIT, fp8-предиктор на Hugging Face). Лёгкий предиктор выбирает нужные тайлы ключей, block-sparse-ядро считает только их: на Waver-T2V-12B генерация ускорилась с 19,4 до 3,8 минут — 5,1x при 95% разреженности.

🌍 При 90-95% разреженности качество определяет не процент отброшенных токенов, а точность воспроизведения структуры плотного внимания: маску дистиллируют через KL-дивергенцию, тайлы подбирают для каждой головы и слоя.

👤 Код воспроизводим на своём железе: инструкции покрывают RTX 4090, Hopper и Blackwell, а scripts/generate.py сравнивает dense- и Veda-версии с таймингами. На RTX 4090 клип 14,4 с для MiniMax-H3 идёт в 3,1 раза быстрее плотного внимания.

Источник 1: https://veda-sparse.github.io/ Источник 2: https://github.com/veda-sparse/Miowtion