Flash Attention-2 под Turing и Винду
[Репозиторий проекта][Cопроводительный блогпост]
Оригинальный Flash Attention поддерживает только архитектуры NVIDIA начиная с Ampere и новее (см. issue).
Но некий Кулибин нашелся и написал тритоновские ядра, которые работают начиная с Turing, с сопроводительным блогпостом. Сам пост довольно содержательный и полезный для тех, кто хотел бы вспомнить, что такое Флэш, и с чего его едят.
Не хватает сильно, правда, сравнения скорости с наивной реализацией, чтобы понять, насколько оно действительно полезно.
Post #605
3.26K
- 🔥 12
- ❤ 7
- 👍 3