🧪Эксперименты
Метод прогнали на семействах моделей Llama-3 и Qwen-3. Качество замеряли на 4 задачах из OpenLLM Leaderboard V1 (GSM8K, MMLU-CoT, HellaSwag, Winogrande). И отдельно для Llama-3.1-8B-Instruct Platinum бенч (сборная солянка из задач, откуда почистили примеры с забагованными условиями или ответами).
Основные наблюдения следующие:
📌 INT4 (group_size=32, без квантизации скейлов) ~= NVFP4
📌 MXFP4 заметно хуже NVFP4 по качеству
📌 Вращения заметно улучшают MXFP, но не особо полезны для NVFP. Разрыв между двумя MXFP и NVFP все равно существенный.
📌 QAT тоже дает более заметный прирост метрик для MXFP, для NVFP побить GPTQ оказывается непросто.
📌 Для малюток размером 1B параметров просадки большие - до 20% от исходного качества, для моделей побольше - Qwen3-32B / Llama-3.3-70B-Instruct в пределах 1-2%.
Использование QuTLASS кернелов для матричных умножений позволяет достичь ускорения, близкого к максимально возможному (без учёта операций с поворотами и скейлами). MXFP демонстрирует немного более высокую скорость по сравнению с NVFP. Матричные операции ускоряются в 4 раза на B200 и в 6 раз на RTX5090 (против half precision). Общее ускорение (end-to-end) составляет до 2 раз на B200 и до 6 раз на RTX5090.
💡 Выводы
FP4 в режиме post-training weight+activation квантизации дает довольно хорошее ускорение, но некоторую просадку в качестве. Отказ от FP в пользу INT не столько уж очевидно правильный шаг. На рассмотренных задачах большие модели почти lossless, но не факт, что так будет на бенчах посложнее - требующих сложных цепочек рассуждений или агентских. Будем посмотреть.
Post #556
1.72K
- 🔥 4
- 🤔 2
- ❤ 1