VC-Attention
ускорение генерации видео до 1.7x от Nunchux AI
Стандартное внимание в диффузионных трансформерах замедляет генерацию видео: все вычисления в FP32, много лишних операций. VC-Attention решает это без переобучения модели.
V-Smooth группирует похожие токены и снижает ошибку квантования значений. ExpCast-FP8 меняет экспоненту в FP32 на прямой перевод результатов в FP8
На RTX 5090 внимание Wan2.2 ускорилось в 3.58 раза, полная генерация в 1.7 раза
Проверили на Wan2.2, LongCat-Video, HunyuanVideo-1.5 и MiniMax-H3
Nunchux Attention - проприетарное расширение VC-Attention. Усоряет MiniMax-H3 в 1.91x против BF16 FlashAttention-4 на B200
Бесплатный доступ для H3 обещают скоро открыть
Вейтлист
Спасибо @Endorpheen
#optimization
VK | MAX
Post #14550
1.67K