Qwen3.8-27B теперь выдает честные 70 токенов/с прямо на ноутбуке благодаря выходу DFlash 2.
Это новое поколение спекулятивного декодирования, основанное на методе блочной диффузии.
Технология разгоняет модель на MacBook Pro с чипом M5 Max, увеличивая скорость авторегрессионного декодирования до 4,6 раза. При этом итоговый результат остается на 100% идентичным оригиналу качество вывода не страдает ни на один токен. ⚡️
Новые черновые модели для Qwen3.8-27B уже доступны с нативной поддержкой популярных движков SGLang, vLLM, llama.cpp и oMLX. Подробный разбор подхода и того, как это работает, можно найти здесь
Post #1994
1.42K