Post #79
3.94K
Disaggregated quantization
Новая статья. Процессим LLM префилл и генерацию разными квантизациями одной модели. Дообучаем обе вместе с учетом того какой токен процессится какой моделью. Чекпоинт для префилла можно сгрузить на SSD, спрятав подгрузку за long-context промпт прцессиногом, чтобы память была как только у модели для генерации.
Статья: arxiv.org/abs/2609.26333
Код: GitHub
Qwen3.8 NVFP4 prefillers: HF Hub
Новая статья. Процессим LLM префилл и генерацию разными квантизациями одной модели. Дообучаем обе вместе с учетом того какой токен процессится какой моделью. Чекпоинт для префилла можно сгрузить на SSD, спрятав подгрузку за long-context промпт прцессиногом, чтобы память была как только у модели для генерации.
Статья: arxiv.org/abs/2609.26333
Код: GitHub
Qwen3.8 NVFP4 prefillers: HF Hub
- 👍 9
- 💅 1
















