Отличный материал по современному программированию GPU для систем машинного обучения.
MLC Community разбирает архитектуру GPU практически с нуля: потоки и варпы, иерархию памяти, CUDA Cores и Tensor Cores, TMA, устройство Blackwell, GEMM и Flash Attention 4. Отдельный упор сделан на то, как писать действительно быстрые ядра и эффективно загружать вычислительные блоки GPU.
https://mlc.ai/modern-gpu-programming-for-mlsys/chapter_background/index.html
👉 @PythonPortal
Post #6142
4.43K

- ❤ 7