TGViewer
КПД КПД @quant_prune_distill · 3.48K subscribers
Post #846 728
🧩 Disaggregated Quantization: Specializing LLM Prefill and Decode

📄 Статья

Обычно для префилла и декода используется одна и та же модель, более того — одни и те же веса.

Однако с вычислительной точки зрения эти операции сильно различаются:

- 🧮 На префилле много вычислений, поэтому обычно упираемся в скорость матричных операций.
- 💾 На декоде же упираемся в скорость памяти.

Поэтому кажется логичным оптимизировать каждый из этапов по-своему.

И потому команда из IST и NVIDIA с первым авторством @black_samorez предлагает подход, оптимизирующий качество и скорость за счёт разного сжатия на этих двух стадиях.
More from @quant_prune_distill
  1. Sep 29, 2026⚙️ Метод На префилле имеем дело с тяжёлыми матричными умножениями, поэтому для ускорения ц…
  2. Sep 24, 2026Метрики, которые мы заслужили. Карточка модели на лицехватс
  3. Sep 23, 2026🛠️ Метод Авторы предлагают довольно интересную схему генерации негативного условия: - 📝…
  4. Sep 23, 2026🧠 Negative Self-Distillation: Learning to Reason by Avoiding Flaws 📄 Статья Обыкновенно…
  5. Sep 22, 2026From AR to Diffusion: Efficiently Adapting Large Language Models with Strictly Causal and…
  6. Sep 21, 2026⚙️ Метод 💡 Идея довольно проста: некоторую долю r от обучения подаём на вход и пытаемся п…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →