Qwen3.8-27B уместили в 6 ГБ вместо 54 ГБ. Окей, но какой ценой?
Сегодня нашел время поиграться с Ternary Bonsai 2 27B – новой сжатой версией Qwen3.8-27B от стартапа PrismML. Оригинальная модель в полной точности весит 54 ГБ, эта – 6 ГБ. Ей хватит видеокарты на 10–12 ГБ или Мака с 16 ГБ единой памяти.
Обычно маленькие модели получают иначе: берут меньше параметров и учат их на ответах большой модели – это дистилляция. Меньше параметров – меньше знаний. У PrismML все 27 миллиардов параметров на месте, но каждый записан не 16 битами, а одним из трех значений: −1, 0 или +1. Как именно этого добились, компания не рассказывает.
Сжимать модели умеют давно, и полную версию дома никто не держит: та же Qwen в 4-битном сжатии занимает 18 ГБ и влезает в одну карту на 24 ГБ. Проблемы начинаются ниже: обычное сжатие до 6–7 ГБ модель заметно калечит. PrismML утверждает, что их версия сохраняет 98% качества, причем от оригинала на 54 ГБ – того, которому нужны две RTX 5090 или серверный ускоритель.
Я запустил Codex на GPT-6 и дал задачу установить четыре модели: Bonsai 2 27B, обычный “двухбитный” квант той же Qwen (7 ГБ), маленькую Qwen3.5 на 9 млрд параметров в четырех битах (тоже около 6 ГБ). А для контроля добавил Qwen3.8 в пяти битах, которая весит 20 ГБ.
Каждой Codex дал пять заданий: рассказ, деловое письмо, объяснение школьнику, почему летом тепло, пересказ и склонение числительных. Считали грамматические ошибки: квантованные модели часто продолжают неплохо отвечать на английском, но проседают в других языках.
Обычный квант посыпался, как и положено: “Северный полюб”, “вернулся с девяно книгами”, а рассказ на середине зациклился на фразе “Ты – Алекс” и оборвался на полуслове. Qwen3.5 на 9 млрд параметров написала чище всех, но в объяснении про времена года запуталась в физике. Bonsai при меньшем размере по грамотности не отличалась от контрольной модели, которая втрое тяжелее, – по три ошибки на четыре текста.
Это, конечно, не профессиональный прогон, но в задачах уровня чат-бота Ternary Bonsai 2 27B неожиданно оказалась очень хороша – и цифра в 98% качества напоминает правду.
Но эти 98% – отличный пример того, почему важно смотреть не на общую цифру, а на то, из каких бенчмарков она собрана.
Озвученная стартапом цифра в 98% основывается на двадцати тестах, где у задачи есть проверяемый ответ: знания, математика, код, вызов инструментов. Причем в режиме максимального рассуждения – с обычным в том же отчете выходит 96%, а на самых трудных заданиях 86–90% А рассуждения тратят токены и быстрее забивают контекстное окно – у локальных моделей оно и так небольшое.
При этом в 98% не стали включать два агентских бенчмарка два агентских бенчмарка – работу в терминале и починку багов в чужих репозиториях – в них Bonsai набирает 53 против 70 и 61 против 81 у оригинала, то есть уже три четверти от результата. Причина простая: работа ИИ-агента состоит из множества шагов, поэтому если в начале допустить ошибку – то в цепочке из пятидесяти шагов без присмотра она разрастется.
В чате шаги “ручные”: ошибку поймаете вы сами или модель при перепроверке. Здесь риск другой, и я его уже называл: забьется контекстное окно – и модель начнет забывать начало беседы.
Но Bonsai 2 – впечатляющее демо прогресса в локальных моделях. На системе с 10-16 ГБ памяти ее можно держать для коротких задач: суммаризации, перевода, ответов на вопросы. Главное – следить за контекстом.
Для более толстых конфигураций, вроде моей RTX 3090, теперь появляется выбор: или поставить модель помощнее, но с маленьким контекстом, или – Bonsai 2, с которой уже можно вести продолжительные диалоги.
Для агентских задач все равно нужна подписка на GPT или Claude – и я пока не уверен, можно ли оптимизировать открытые модели настолько, чтобы они справлялись с такими задачами при текущих объемах памяти.
—
Для тех, кто хочет вкатиться в открытые модели, у меня есть отдельный лонгрид. Там разбираю их основные характеристики, какое железо нужно, а также рассказываю, как поставить и настроить открытую модель всего за вечер. Под Bonsai 2 текст уже обновлен.
Читаем здесь!
Post #710
5.97K

- ❤ 52
- 👍 22
- 🔥 10
- 😁 3
- 👏 1