TGViewer
Geeky Log Geeky Log @geekylog · 31 subscribers
Post #6 51
Только я, значит, собрал всю матрицу из 16 вариантов MLX oQ-квантов для Qwen3.6-35B-A3B, как оказалось, что всё это время в Qwen3.5/3.6 был встроен нативный Multi-Token Prediction (MTP), а мы просто выбрасывали специальные mtp.* тензоры за непониманием как их использовать.

Самое красивое, что в отличие от DFlash, не нужна специально обученная драфтовая модель. Предсказание на 2 токена вперёд конечно же упрётся в коэффициент принятия в каждом конкретном случае, но всё равно звучит обнадёживающе "просто".

Пока завезли в oMLX v0.3.9.dev1 со встроенным патчингом внутренностей mlx_lm/vlm, а у меня проблемы с памятью при квантизации. Но всё равно придётся всё переделывать и перезаливать… Чего не сделаешь ради прогресса.
  • 👍 3
More from @geekylog
  1. Sep 22, 2026Горшочек! https://openai.com/index/introducing-gpt-6-sol-and-luna/
  2. Sep 22, 2026https://www.anthropic.com/claude-opus-5-5
  3. Sep 22, 2026photo post
  4. Sep 22, 2026https://mimo.xiaomi.com/mimo-v2-6
  5. Sep 21, 2026https://x.ai/news/grok-4-7
  6. Sep 21, 2026https://habr.com/ru/companies/yandex/articles/1083300/
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →