TGViewer
Order of Six Angles Order of Six Angles @orderofsixangles · 5.38K subscribers
Post #3031 2.59K
Интересный твит попался https://x.com/DogukanUrker/status/2079569892303344044

Разработчик показал запуск модели на одной RTX 3060 12 ГБ с полным контекстом 262 144 токена и скоростью около 100 токенов/с благодаря MTP (Multi-Token Prediction).
Что использовалось:
• Gemma 4 12B QAT (Q4_K_XL)
• MTP speculative decoding в llama.cpp
• Полностью GPU-инференс, без CPU offload
• Загрузка VRAM - около 97%
•
Самый интересный момент - организация KV-кэша.

Для основной модели используется кэш в Q8, а для MTP-драфтера — FP16. Попытка квантовать кэш драфтера заметно снижала acceptance, поэтому такой гибридный вариант оказался оптимальным. По словам автора, даже при контексте 262K acceptance держится около 70%.
X (formerly Twitter) Doğukan (@DogukanUrker) on X Gemma 4 12B on a single RTX 3060: the full 262,144 context at ~100 tok/s. (config below) dense model -> MTP speculative decoding hits the full ~2.4 x 42 -> ~100 tok/s just by turning the drafter …
More from @orderofsixangles
  1. Sep 26, 2026Post #3203
  2. Sep 25, 2026Официальный IDA MCP https://hex-rays.com/blog/hex-rays-ida-mcp-server
  3. Sep 23, 2026Короче поставил себе GrokBot. Будем изучать, что за зверь такой
  4. Sep 22, 2026Windows Exploitation Techniques: Dangling COM Object Registrations https://projectzero.goo…
  5. Sep 22, 2026анонс на Apsara Conference 2026. Alibaba заявила, что сейчас тренирует следующее поколение…
  6. Sep 22, 2026спустя 6 лет обновил тулзу свою https://github.com/thatskriptkid/apk-infector-Archinome/tr…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →