Bridging the Gap Between Promise and Performance for Microscaling FP4 Quantization
[Статья][Экспериментальный код][Либа с быстрыми Blackwell кернелами][Коллекция на лицехватс]
Вместе с выходом поколения ⚫️well зеленые добавили поддержку Miscroscaling FP4 форматов (разбиралось выше тут и тут ).
Утверждается, что данные форматы дают существенную экономию памяти и ускорение вычислений (при weight+activation квантизации и для compute-bound сценариев) “практически” без просадки в качестве.
И в рамках данной работы мы с коллегами из IST Austria / EPFL решили проверить, что есть это “практически“ на самом деле, и исследовать полезность разных техник из литературы и личного арсенала для квантизации LLMок.
Post #554
1.55K
