Только я, значит, собрал всю матрицу из 16 вариантов MLX oQ-квантов для Qwen3.6-35B-A3B, как оказалось, что всё это время в Qwen3.5/3.6 был встроен нативный Multi-Token Prediction (MTP), а мы просто выбрасывали специальные mtp.* тензоры за непониманием как их использовать.
Самое красивое, что в отличие от DFlash, не нужна специально обученная драфтовая модель. Предсказание на 2 токена вперёд конечно же упрётся в коэффициент принятия в каждом конкретном случае, но всё равно звучит обнадёживающе "просто".
Пока завезли в oMLX v0.3.9.dev1 со встроенным патчингом внутренностей mlx_lm/vlm, а у меня проблемы с памятью при квантизации. Но всё равно придётся всё переделывать и перезаливать… Чего не сделаешь ради прогресса.
Post #6
51

- 👍 3