Veda от ByteDance, HKU и USTC
Разреженное внимание для видео-диффузии, которое не ломает качество. Полный attention учит предиктор выбирать только нужные 128-токенные тайлы - на 90-95% тратится меньше вычислений при почти незаметной разнице
• 90% разреженность на уровне полного attention по человеческим оценкам
• топ-k пропуск тайлов - внимание масштабируется почти линейно, а не O(N²)
• головы и слои получают свои формы тайлов - локальные и дальние зависимости
• дистилляция от полного attention через KL - до бинаризации маски
• 720P 241 кадр: 19.4 мин до 3.8 мин, ускорение 5.1x
• per-layer attention 10.5x быстрее FlashAttention-3
• 90% sparsity на WaverBench1.0 не проигрывает dense (50% против 49%)
Связка под #MiniMaxH3 #T2VA: Ускорение до 2.76x end-to-end на RTX 4090
Гитхаб
HF
Спасибо @m_franz
#optimization
Post #14786
1.02K