CCQ: Convolutional Code for Extreme Low-bit Quantization in LLMs
[Статья] [Код]
Введение
Хороший метод квантизации должен, с одной стороны, сильно сжимать ⬇️ модель, с другой — сохранять качество 🥉, а с третьей — еще и заметно ускорять 🏃 инференс.
Скалярные методы квантизации дают хорошее ускорение, но теряют качество при сильном сжатии. Векторные методы лучше сохраняют качество при той же степени сжатия, но работают значительно медленнее из-за сложной и вычислительно тяжёлой деквантизации.
В этой статье ребята из Baidu пытаются и рыбку 🐟 съесть, и косточкой 🦴 не подавиться.
Post #506
1.8K

- ❤ 1
- 👍 1