TGViewer
Love. Death. Transformers. Love. Death. Transformers. @lovedeathtransformers · 25.7K subscribers
Post #11105 4.44K

Forwarded from black_samorez

Disaggregated quantization

Новая статья. Процессим LLM префилл и генерацию разными квантизациями одной модели. Дообучаем обе вместе с учетом того какой токен процессится какой моделью. Чекпоинт для префилла можно сгрузить на SSD, спрятав подгрузку за long-context промпт прцессиногом, чтобы память была как только у модели для генерации.

Статья: arxiv.org/abs/2609.26333
Код: GitHub
Qwen3.8 NVFP4 prefillers: HF Hub
  • 👾 31
  • 👍 10
  • 🔥 4
  • ✍ 1
  • 💩 1
More from @lovedeathtransformers
  1. Sep 28, 2026Накидайте лайков лютому https://huggingface.co/papers/2609.26333
  2. Sep 28, 2026в LA нормальный кофе теперь??? https://www.google.com/maps?ll=34.090422,-118.373917&z=14&t…
  3. Sep 26, 2026Забавно что авторка гениального the federation of nordland в один момент жизни слегка изме…
  4. Sep 26, 2026⭐️🔠🔠🔠🔠🔠🔠🔠⭐️ ★ Как я упоминала ранее, обстоятельства моей жизни изменились, поэтому…
  5. Sep 26, 2026Self-Play Pretraining with Zero Data https://arxiv.org/abs/2609.30063
  6. Sep 25, 2026Evidence of Linear Superposition in LLMs Языковые модели ЕЩЁ ЛИНЕЙНЕЕ, чем мы думали. Это,…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →