Вот сейчас для того чтобы запускать LLM мы все очень сильно упираемся в видеопамять
Если хоть какой-то слой модели вываливается в оперативку то скорость генерации токенов падает разительно
И вот один парень в реддите с ником sadnessdevil показал как загрузить большую часть KV-кэша модели Qwen3.8-Flash-Next в оперативную память (RAM) с минимальной потерей скорости декодирования
Это стало возможным благодаря специфической архитектуре модели, которая позволяет использовать квантованные веса, едва помещающиеся в видеопамять GPU, и при этом работать с контекстом длиной до 1 миллиона токенов без необходимости квантовать сам кэш.
Ключевой механизм работы заключается в том, что только 12 из 48 слоев модели используют традиционный KV-кэш, тогда как остальные 36 являются слоями gated delta-net с фиксированным рекуррентным состоянием, не растущим с длиной контекста
Чел получает 80 токенов в сек на довольно скромном железе
https://www.reddit.com/r/LocalLLaMA/comments/1whx5xi/you_can_offload_most_of_qwen38flashnexts_kv_cache/
Post #2302
2.32K
- 🔥 29
- 👎 2