Запустить модель локально можно в разном кванте. И часто можно увидеть что-то вроде "q4 сохраняет 99% качества ответа при этом меньше в 6 раз". Вот я никогда не понимал этой вот первой цифры. Что вообзе означает эти 99 процентов? Моя задача то будет решаться или нет?
Пользователь с M5 Max и 128 ГБ оперативной памяти столкнулся с тем что модель Qwen-Next в задачах на программирование работает хуже, чем Qwen 3.8 27b, несмотря на общие хвалебные отзывы в сообществе. Проблема оказалась в неправильном сравнении квантизаций: автор запускал 27b в формате q8, а MTPLX позволял использовать для Qwen-Next только q4.
Qwen-Next использует экспериментальную архитектуру flash-next, которая отличается от предыдущих версий 3.5 и 3.6. Ключевая причина отставания в производительности на сложных задачах — незрелость backend-инференса. У Qwen 3.8 27b за полгода работы сообщества накоплен огромный оптимизационный опыт, тогда как для новой архитектуры еще нет стабильных решений. В MoE-моделях квантизация KV-кеша сильно бьет по качеству, поэтому рекомендуется использовать f16 cache или нативный Q5 с offload на диск для достижения лучших результатов.
Прямое сравнение моделей в квантах (q8 против dynamic q4) дает искаженную картину
Post #2298
1.99K
- 👍 14
- 👎 4