TGViewer
Нейроканал Нейроканал @neuro_channel · 11.7K subscribers
Post #2851 2K
Quesma прогнала кванты Qwen3.8 27B от Unsloth через GPQA Diamond, IFBench и Terminal-Bench 2.1 и сожгла на это $3000 на арендованных GPU. Вопрос практический: сколько памяти нужно, чтобы не потерять качество.

Ответ: у 4-битного Q4_K_M на 17 ГБ измеримой разницы с полной BF16 на 55 ГБ нет ни на одном из трёх тестов. На Terminal-Bench результаты совпали, на картинке. Такой квант влезает в 24 ГБ вместе с контекстом на 64 тысячи токенов, то есть в RTX 4090. 2-битный UD-Q2_K_XL на 10,7 ГБ по инструкциям и знаниям почти не отстаёт, а в агентном кодинге проседает до уровня Opus 4.7 и на тех же решённых задачах пишет примерно на четверть больше токенов. 1-битные кванты на GPQA отвечают на уровне случайного угадывания, а на xhigh ещё хуже, потому что думают до исчерпания бюджета и отдают пустой ответ.

Отдельное наблюдение про уровень рассуждений: у модели по умолчанию xhigh, и на GPQA он даёт заметно больше low и medium, но на IFBench разницы нет, а лишние токены стоят денег.

@neuro_channel
  • ❤ 9
  • 🆒 2
More from @neuro_channel
  1. Sep 20, 2026Tencent выложила WeVisDoc, модели на 2 и 4 млрд параметров, которые превращают снимок стра…
  2. Sep 19, 2026StepFun выпустила Step 5 Preview, и Artificial Analysis уже её замерили: 44 балла в индекс…
  3. Sep 19, 2026На следующей неделе ожидается сразу несколько крупных релизов. Расскажу про самые интересн…
  4. Sep 18, 2026Qwen выложила Qwen3.8-Omni-Flash: на вход текст, картинки, звук и видео, контекст 1M токен…
  5. Sep 18, 2026PrismML выпустила Ternary Bonsai 2 27B: тернарное сжатие теперь сделано поверх Qwen3.8 27B…
  6. Sep 17, 2026Стелс-модель Union Alpha раскрылась: это Pareto 26.9 от компании The Unbiased Company. Вче…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →