Quantization-Aware Distillation for NVFP4 Inference Accuracy Recovery
[Статья]
Ребята из Нвидии выкатили техрепорт про дистилляцию моделей, с квантизованными в NVFP4 весами и активациями. В репорте гоняют квантизацию + дистилляцию на семействе собственных моделей и тюнов.
С точки зрения научной новизны так-то ничего интересного, но можно отметить следующее:
📌 Дистилляция на логитах менее подвержена оверфиту (да ладно?)
📌 Данные важны (удивительно, не правда ли?)
📌 KL-дивергенция лучше MSE для логитов (вот это да!)
📌Надо аккуратно тюнить learning rate (да ну?)
А так, в целом, удается почти не потерять в качестве.
Post #636
2.15K

- 😁 17