Кроме Gemma 4 31B и 26B-A4B, Alibaba выпустила Dense Qwen3.6-27B и Mixture of Experts Qwen3.6-35B-A3B, разделяющие на текущий момент топ среди моделей размером ± 30 миллиардов параметров.
И наконец можно сказать, что модели, обладающие хоть какой-то адекватностью, влезают в память обычного игрового ПК с 16Gb видео + 32Gb обычной памяти.
Причём влезают вместе с большим контекстом - в случае с MoE Qwen, с запасом влезает 262144 токенов, а в случае с dense - 120000 токенов (но dense на 27B и умнее значительно) при квантизации Q6.
Можно уже задавать вопросы по среднего размера пет-проекту и так далее, you name it.
При подключении в VS Code через Cline "втупую" с помощью LM Studio работает не очень быстро, но работает. Наверняка можно выжать больше токенов, но мне не очень хочется инвестировать время в это.
А ещё у Qwen нормально работают размышления "из коробки", в отличие от Gemma
Вообще, у всех этих локальных моделей вайб каких-то выживальщиков:
"Наконсервирую моделей на случай апокалипсиса, а там видно будет", "Вот наступит апокалипсис, я запущу свой дизель-генератор и буду задавать Gemma свои вопросики"
Реальных причин для их использования в реальной жизни нет, если вы не занимаетесь опасной\преступной\покрытой NDA\какой-нибудь журналистской деятельностью и крайне боитесь утечек памяти.
Ну или вы запускаете uncensored-версии и пишете highly-personalized секс-рассказы в параллель с изготовлением нелегальных субстанций, бог вам судья😐
Post #2119
269


- 👍 10
- 🤯 2