Open-VC Attention
Открытая реализация VC-Attention (возможно, этого) от MachGen для NVIDIA Blackwell. Почти 2× быстрее BF16 FlashAttention-4 на B200 при генерации видео-моделей вроде MiniMax H3. Плюс ещё ~20% к оригинальному методу из статьи.
Как ускоряет
• ExpCast — вероятности softmax считаются без экспоненты, одной FMA-инструкцией
• Поиск максимума в середине окна ключей — меньше рескейлов
• Варп-специализированный конвейер: загрузка, матричные умножения и softmax разнесены по варпам
• Упакованный V в транспонированном виде — тензорные ядра читают непрерывно
• Fusion подготовки входов в CUDA-граф
Вместо V-Smooth из статьи — «V residual repair»: чинит только худшие токены V, что дает почти тот же эффект за меньшую цену. На MiniMax-H3 в 15-сек ролике без ремонта лицо за визором схлопывалось в темную дыру — с ремонтом 0.5% рендерится верно.
github.com/MachGen/open-vc-attention
#optimization
Post #14982
1.14K

- 👍 7