Disaggregated Quantization
LLM в два раза быстрее и дешевле
Префилл и генерацию теперь обрабатывают разными квантизациями одной модели. Префилл — быстрым NVFP4, генерацию — сверхлёгкими 1–3-битными весами. Чекпоинт префилла грузится на SSD, подгрузка прячется за длинным контекстом — памяти нужно как у модели только для генерации
Что это дает
• Длинные промпты летают — NVFP4 ускоряет загрузку контекста
• Генерация дешевле — 1–3 бита вместо 4–8, меньше трафика из памяти
• Память как у маленькой модели — чекпоинт префилла на SSD, не жрет VRAM
• Точность не падает — активацию на decode не квантизируют
Уже работает на Qwen3 и Gemma 3
Qwen3.8 NVFP4 prefiller на HuggingFace
#optimization #llm
MAX
Post #14843
338
- 👍 4