TGViewer
DL in NLP DL in NLP @dlinnlp · 11.6K subscribers
Post #1767 11.4K
FlashAttention-3 📸

Блог и статья: tridao.me/blog/2024/flash3/
Код: github.com/Dao-AILab/flash-attention

1.5-2.0 раза быстрее чем FlashAttention 2 в FP16, почти в 3 раза быстрее в FP8

Flash 2 был оптимизирован под А100 и достигал 70% теоретических max flops, Flash 3 оптимизирован под H100 и достигает 75%. Для этого активно использовали библиотеку NVIDIA CUTLASS которая почти напрямую общается с железом и позволяет использовать хитрые фичи H100. Например использовать специальное железо (Tensor Memory Accelerator) для копирования тензоров между global и shared memory и Warpgroup Matrix Multiply-Accumulate (который я так и не понял что такое, но как-то связан с тензорными ядрами)

Сверху этого переписали код чтобы матричное умножение вычислялось (на tensor cores) параллельно с softmax (на multi-function unit) и сделали пару хаков чтобы FP8 давал более точные результаты

Выглядит очень классно, надо пробовать. Жаль что еще нету edge железа на Hopper
  • 🔥 33
  • ❤‍🔥 7
  • 👍 3
More from @dlinnlp
  1. Feb 21, 2025https://www.youtube.com/watch?v=uVcBa6NXAbk https://www.1x.tech/discover/introducing-neo-g…
  2. Jan 27, 2025В продолжение темы, Jay Alammar, у которого были прекрасные визуальные объяснения про рабо…
  3. Jan 23, 2025Всем приветики. Давно не было постов, тк становится всё сложнее вести канал. Не буду обеща…
  4. Nov 23, 2024Programming Massively Parallel Processors https://a.co/d/6QEiuCq Наткнулся на книгу котора…
  5. Oct 10, 2024Но дадут ли нобелевку по литературе за Deep Learning Book
  6. Oct 8, 2024Почему не стоит верить nvidia-smi “GPU utilization” arthurchiao.github.io/blog/understandi…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →