Коллеги из Сбера опубликовали статью "NABLA: Neighborhood Adaptive Block-Level Attention".
Статья предлагает новый механизм блочно-разреженного внимания для диффузионных трансформеров: вместо вычисления всей маски внимания (Full Attention) можно сжать матрицы Query и Key и эффективно обнаружить только наиболее важные блоки с помощью кумулятивной функции распределения Softmax. После этого вычисления выполняются только для наиболее важных блоков. Метод позволяет ускорить генерацию модели Wan 2.1-14B (на данный момент это лучшая из открытых моделей генерации видео) в 2.7 раза.
Метод не требует написания специальных CUDA-ядер и полностью совместим с Flex Attention из PyTorch.
Upvote статьи на Hugging Face приветствуется🔝
Статья на HF
Post #725
3.36K

- 👏 27
- ❤ 4
- ⚡ 4
- 🏆 3
- 👍 2
- 🔥 1