TGViewer
КПД КПД @quant_prune_distill · 3.49K subscribers
Post #506 1.8K
CCQ: Convolutional Code for Extreme Low-bit Quantization in LLMs
[Статья] [Код]

Введение

Хороший метод квантизации должен, с одной стороны, сильно сжимать ⬇️ модель, с другой — сохранять качество 🥉, а с третьей — еще и заметно ускорять 🏃 инференс.

Скалярные методы квантизации дают хорошее ускорение, но теряют качество при сильном сжатии. Векторные методы лучше сохраняют качество при той же степени сжатия, но работают значительно медленнее из-за сложной и вычислительно тяжёлой деквантизации.

В этой статье ребята из Baidu пытаются и рыбку 🐟 съесть, и косточкой 🦴 не подавиться.
  • ❤ 1
  • 👍 1
More from @quant_prune_distill
  1. Oct 7, 2026А еще есть красивая демка
  2. Oct 7, 2026⚙️ Метод MMD есть мера различия между двумя распределениями P, Q. Задается некоторый полож…
  3. Oct 7, 2026🧠 Representation-Space MMD for Diffusion Language Models 📄 Статья Первое, что приходит в…
  4. Oct 7, 2026А вообще, можно энкодить все на языке brainfuck и иметь Тьюринг-полную систему.
  5. Oct 7, 2026Jev не генеративен, потому что он не выбирает следующий токен, а выбирает один из варианто…
  6. Oct 6, 2026Совпадение? Не думаю!
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →