TGViewer
johenews johenews @johenews · 3.6K subscribers
Post #2302 2.32K
Вот сейчас для того чтобы запускать LLM мы все очень сильно упираемся в видеопамять

Если хоть какой-то слой модели вываливается в оперативку то скорость генерации токенов падает разительно

И вот один парень в реддите с ником sadnessdevil показал как загрузить большую часть KV-кэша модели Qwen3.8-Flash-Next в оперативную память (RAM) с минимальной потерей скорости декодирования

Это стало возможным благодаря специфической архитектуре модели, которая позволяет использовать квантованные веса, едва помещающиеся в видеопамять GPU, и при этом работать с контекстом длиной до 1 миллиона токенов без необходимости квантовать сам кэш. 

Ключевой механизм работы заключается в том, что только 12 из 48 слоев модели используют традиционный KV-кэш, тогда как остальные 36 являются слоями gated delta-net с фиксированным рекуррентным состоянием, не растущим с длиной контекста

Чел получает 80 токенов в сек на довольно скромном железе

https://www.reddit.com/r/LocalLLaMA/comments/1whx5xi/you_can_offload_most_of_qwen38flashnexts_kv_cache/
  • 🔥 29
  • 👎 2
More from @johenews
  1. Sep 28, 2026Сейчас в топе будут новые угрозы кибербезопасности. Даже интересно какое им дадут имя. И с…
  2. Sep 27, 2026Post #2316
  3. Sep 27, 2026Помните я в прошлые выходные писал про клоунский рейтинг, который называется "Индекс демок…
  4. Sep 25, 2026Если вы любите локальные модели как люблю их я то наверное тоже знаете что сейчас по факту…
  5. Sep 24, 2026Ребят, помните, я в видео упоминал ClaudeHub? Оставлю информацию здесь, чтобы всё было в о…
  6. Sep 24, 2026https://youtu.be/wGfdDnxwp-I
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →