Выбрал и проверил Gemma 4 E4B IT QAT UD-Q4_K_XL (на RTX 3070) с BF16 MTP-драфтером. MTP действительно полезен: ускорение составило 29–34%, включая реально заполненный контекст 114K.
Контекст был выделен на 131 072 токена; длинный prompt реально содержал 114 047 токенов. Его обработка заняла около 61 секунды со скоростью примерно 1874 ток/с.
Конкретно для E4B не подтвердился тезис, что Q8-кэш драфтера резко ухудшает acceptance: показатели совпали с FP16. Q8 оказался лишь примерно на 1,5% медленнее на длинном контексте.
Post #3032
1.25K
Order of Six Angles Интересный твит попался https://x.com/DogukanUrker/status/2079569892303344044 Разработчик показал запуск модели на одной RTX 3060 12 ГБ с полным контекстом 262 144 токена и скоростью около 100 токенов/с благодаря MTP (Multi-Token Prediction). Что использовалось:…
