⠀
Разработчик запускал Qwen3.8-Flash-Next через
llama.cpp на RTX 5070 с 12 ГБ видеопамяти. Получал около 15 токенов/с. Решил, что ему мало.⠀
Написал Strata, свою обвязку конкретно под эту модель и свой компьютер — и, по его замерам, получил около 65 токенов/с с тем же квантом IQ3_XXS. На той же машине: Ryzen 5 7600, 64 ГБ оперативки и Windows.
⠀
При длинном контексте 128K результат для IQ3_XXS ниже: 44,8 токена/с. Указанные в твите 65,1 на 128K относятся к другому, сильнее сжатому варианту Q2_0. Но всё равно впечатляет.
⠀
Ускорил модель на собственном ПК и выложил движок в открытый доступ. Теперь результат можно попробовать воспроизвести.
Инновации, которые нам нужны.
⠀
Рассказ разработчика · Strata · Пост в X
