Интересный твит попался https://x.com/DogukanUrker/status/2079569892303344044
Разработчик показал запуск модели на одной RTX 3060 12 ГБ с полным контекстом 262 144 токена и скоростью около 100 токенов/с благодаря MTP (Multi-Token Prediction).
Что использовалось:
• Gemma 4 12B QAT (Q4_K_XL)
• MTP speculative decoding в llama.cpp
• Полностью GPU-инференс, без CPU offload
• Загрузка VRAM - около 97%
•
Самый интересный момент - организация KV-кэша.
Для основной модели используется кэш в Q8, а для MTP-драфтера — FP16. Попытка квантовать кэш драфтера заметно снижала acceptance, поэтому такой гибридный вариант оказался оптимальным. По словам автора, даже при контексте 262K acceptance держится около 70%.
Post #3031
2.59K