TGViewer
КПД КПД @quant_prune_distill · 3.49K subscribers
Post #806 1.4K
🛠️ Метод

Дабы всё можно было реализовать одним кернелом без обращения к глобальной памяти, надо расписать все вычисления так, чтобы нужные активации всегда лежали под рукой у нужного CTA (Cooperative Thread Array). А ещё хочется избавиться от лишних синхронизаций.

Есть две технические сложности:

1. В наивной реализации сначала идёт gate-проекция, а затем up, и CTA нужно тянуться далеко за нужными элементами матрицы весов.
2. Чтобы получить выход down-проекции, необходимо просуммировать по всей промежуточной размерности.

Проблема 1 решается просто — будем перемежать куски up- и gate-проекции, чтобы CTA мог достать их разом из одного места.

Проблема 2 решается гораздо сложнее, и ей посвящена, по сути, большая часть блога. Если коротко — так расписывается то, как данные подаются в тензорные ядра, синхронизируются consumer- и producer-потоки, пайплайнинг и заумный эпилог. Многие штуки зиждутся на Blackwell-специфичных инструкциях, позволяющих перекрывать в одной операции вычисления и трансфер памяти.

⚙️ Есть у них как bf16-, так и mxfp8-реализация.

📊 Замеры

Сравниваются с наивной торчовой реализацией (дико медленной, само собой, и это даже несерьёзно) и torch.grouped_mm.

В bf16 получают ускорение порядка 20% против grouped_mm и около 2 раз для mxfp8 (против торчового mxfp8). Если убрать requant из торчовой реализации mxfp8, то ускорения почти нет.

🤔 Сравнений с другими эффективными fused-кернелами — SonicMoE и Mixture-of-Kittens — нет, так что непонятно, насколько это круто.
  • 🔥 6
  • ❤ 1
More from @quant_prune_distill
  1. Oct 4, 2026"Горячие" эксперты
  2. Oct 4, 2026photo post
  3. Oct 1, 2026🛠 Метод Типичный scaling law имеет вид: L(N, D) = A N^α + B D^β + c 🔄 Скейлинг по рекурс…
  4. Oct 1, 2026Scaling Laws for Looped Mixture of Experts 📄 Статья Есть MoE, которые как-то скейлятся (п…
  5. Sep 29, 2026⚙️ Метод На префилле имеем дело с тяжёлыми матричными умножениями, поэтому для ускорения ц…
  6. Sep 29, 2026🧩 Disaggregated Quantization: Specializing LLM Prefill and Decode 📄 Статья Обычно для пр…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →