TGViewer
Нейронавт | Нейросети в творчестве Нейронавт | Нейросети в творчестве @greenneuralrobots · 13K subscribers
Post #14843 338
Disaggregated Quantization

LLM в два раза быстрее и дешевле

Префилл и генерацию теперь обрабатывают разными квантизациями одной модели. Префилл — быстрым NVFP4, генерацию — сверхлёгкими 1–3-битными весами. Чекпоинт префилла грузится на SSD, подгрузка прячется за длинным контекстом — памяти нужно как у модели только для генерации

Что это дает
• Длинные промпты летают — NVFP4 ускоряет загрузку контекста
• Генерация дешевле — 1–3 бита вместо 4–8, меньше трафика из памяти
• Память как у маленькой модели — чекпоинт префилла на SSD, не жрет VRAM
• Точность не падает — активацию на decode не квантизируют

Уже работает на Qwen3 и Gemma 3

Qwen3.8 NVFP4 prefiller на HuggingFace

#optimization #llm

MAX
  • 👍 4
More from @greenneuralrobots
  1. Sep 30, 2026OpenAI DevDay 2026 GPT-6.1 Sol — модель для кодинга и профзадач, производительность около…
  2. Sep 29, 2026#humor MAX
  3. Sep 29, 2026Gemini 3.8 Live с Live Avatar Google вывел в общий доступ Gemini 3.8 Live — модель для жив…
  4. Sep 29, 2026Manus 2.0 и Cue Manus выпустил 2.0 Manus Studio — десктоп для профессиональной работы И от…
  5. Sep 29, 2026Привет, я Матвей 🤝 22 года. В онлайне с 15. Пробовал всё: от темок до полу-темок. А потом…
  6. Sep 29, 2026#оффтоп Обратил я внимание на завывания кулеров на минимаксе и узнал о существовании MSI a…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →