TGViewer
сбежавшая нейросеть сбежавшая нейросеть @ai_exee · 23.8K subscribers
Post #710 5.97K
Qwen3.8-27B уместили в 6 ГБ вместо 54 ГБ. Окей, но какой ценой?

Сегодня нашел время поиграться с Ternary Bonsai 2 27B – новой сжатой версией Qwen3.8-27B от стартапа PrismML. Оригинальная модель в полной точности весит 54 ГБ, эта – 6 ГБ. Ей хватит видеокарты на 10–12 ГБ или Мака с 16 ГБ единой памяти. 

Обычно маленькие модели получают иначе: берут меньше параметров и учат их на ответах большой модели – это дистилляция. Меньше параметров – меньше знаний. У PrismML все 27 миллиардов параметров на месте, но каждый записан не 16 битами, а одним из трех значений: −1, 0 или +1. Как именно этого добились, компания не рассказывает. 

Сжимать модели умеют давно, и полную версию дома никто не держит: та же Qwen в 4-битном сжатии занимает 18 ГБ и влезает в одну карту на 24 ГБ. Проблемы начинаются ниже: обычное сжатие до 6–7 ГБ модель заметно калечит. PrismML утверждает, что их версия сохраняет 98% качества, причем от оригинала на 54 ГБ – того, которому нужны две RTX 5090 или серверный ускоритель.

Я запустил Codex на GPT-6 и дал задачу установить четыре модели: Bonsai 2 27B, обычный “двухбитный” квант той же Qwen (7 ГБ), маленькую Qwen3.5 на 9 млрд параметров в четырех битах (тоже около 6 ГБ). А для контроля добавил Qwen3.8 в пяти битах, которая весит 20 ГБ. 

Каждой Codex дал пять заданий: рассказ, деловое письмо, объяснение школьнику, почему летом тепло, пересказ и склонение числительных. Считали грамматические ошибки: квантованные модели часто продолжают неплохо отвечать на английском, но проседают в других языках.

Обычный квант посыпался, как и положено: “Северный полюб”, “вернулся с девяно книгами”, а рассказ на середине зациклился на фразе “Ты – Алекс” и оборвался на полуслове. Qwen3.5 на 9 млрд параметров написала чище всех, но в объяснении про времена года запуталась в физике. Bonsai при меньшем размере по грамотности не отличалась от контрольной модели, которая втрое тяжелее, – по три ошибки на четыре текста.

Это, конечно, не профессиональный прогон, но в задачах уровня чат-бота Ternary Bonsai 2 27B неожиданно оказалась очень хороша – и цифра в 98% качества напоминает правду.

Но эти 98% – отличный пример того, почему важно смотреть не на общую цифру, а на то, из каких бенчмарков она собрана.

Озвученная стартапом цифра в 98% основывается на двадцати тестах, где у задачи есть проверяемый ответ: знания, математика, код, вызов инструментов. Причем в режиме максимального рассуждения – с обычным в том же отчете выходит 96%, а на самых трудных заданиях 86–90% А рассуждения тратят токены и быстрее забивают контекстное окно – у локальных моделей оно и так небольшое.

При этом в 98% не стали включать два агентских бенчмарка два агентских бенчмарка – работу в терминале и починку багов в чужих репозиториях – в них Bonsai набирает 53 против 70 и 61 против 81 у оригинала, то есть уже три четверти от результата. Причина простая: работа ИИ-агента состоит из множества шагов, поэтому если в начале допустить ошибку – то в цепочке из пятидесяти шагов без присмотра она разрастется.

В чате шаги “ручные”: ошибку поймаете вы сами или модель при перепроверке. Здесь риск другой, и я его уже называл: забьется контекстное окно – и модель начнет забывать начало беседы.

Но Bonsai 2 – впечатляющее демо прогресса в локальных моделях. На системе с 10-16 ГБ памяти ее можно держать для коротких задач: суммаризации, перевода, ответов на вопросы. Главное – следить за контекстом.

Для более толстых конфигураций, вроде моей RTX 3090, теперь появляется выбор: или поставить модель помощнее, но с маленьким контекстом, или – Bonsai 2, с которой уже можно вести продолжительные диалоги. 

Для агентских задач все равно нужна подписка на GPT или Claude – и я пока не уверен, можно ли оптимизировать открытые модели настолько, чтобы они справлялись с такими задачами при текущих объемах памяти.


Для тех, кто хочет вкатиться в открытые модели, у меня есть отдельный лонгрид. Там разбираю их основные характеристики, какое железо нужно, а также рассказываю, как поставить и настроить открытую модель всего за вечер. Под Bonsai 2 текст уже обновлен.

Читаем здесь!
  • ❤ 52
  • 👍 22
  • 🔥 10
  • 😁 3
  • 👏 1
More from @ai_exee
  1. Sep 22, 2026На видео – 39-секундная нарезка боя агента на GPT-6 Astra с Эндер-драконом – финальным бос…
  2. Sep 21, 2026В штате Anthropic уже 30 тысяч сотрудников нового поколения Ни один из них не человек. Ant…
  3. Sep 21, 2026Уходить из найма ради стартапа – плохой вариант Можно начать с малого: запустить свой небо…
  4. Sep 20, 2026Инженер Microsoft Стивен Тауб рассказал, как перевел движок GitHub Copilot с TypeScript и…
  5. Sep 19, 2026Как относится к ИИ создатель Linux? Зависит от того, какого Торвальдса спросить Первый зли…
  6. Sep 18, 2026Инженера DeepSeek не уволят. В этом и проблема В эссе Лю Шэнъюя есть пилот боевого меха, Г…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →