⚔️🤖 Bonsai 2 27B: Qwen3.8-27B сжали до 5,9 Гбайт
Компания PrismML представила Bonsai 2 27B – сверхкомпактную версию Qwen3.8-27B, рассчитанную на локальный запуск.
Размер модели удалось сократить примерно с 53,8 до 5,95 Гбайт, то есть более чем в девять раз. При этом разработчики заявляют сохранение около 98,2% среднего результата исходной модели на собственном наборе тестов.
🔻 Как удалось сократить размер
В Bonsai 2 применяется трёхуровневое квантование весов – более агрессивный способ сжатия весов, чем привычные 3–4-битные форматы. Средняя плотность хранения составляет около 1,75 бита на один вес. Это позволяет значительно уменьшить объём модели без перехода к более компактной архитектуре: Bonsai 2 по-прежнему основана на полноценной Qwen3.8-27B.
📌 Доступны две основные версии:
– PTQ1_0 – 5,95 Гбайт;
– PQ2_0 – 7,21 Гбайт.
Для мультимодального режима отдельно используется mmproj около 0,63 Гбайт, поэтому комплект для работы с изображениями занимает примерно 6,6 Гбайт.
Модель поддерживает текст, изображения, программирование, рассуждения, вызов инструментов и агентные сценарии, а максимальный контекст достигает 262 тыс. токенов.
🔻 По скорости результат также необычный для 27B-модели.
В тестах GGUF-версии PrismML:
– RTX 5090 – около 120–130 токенов/с;
– RTX 4090 – около 81–91 токена/с;
🔻 Сохранение качества после квантования
В испытаниях PrismML исходная Qwen3.8-27B получила средний результат 85,4, а Bonsai 2 – 83,9. На математике и программировании разница минимальна, однако на сложных длительных агентных задачах снижение качества может быть заметнее.
После уменьшения размера модели более чем в девять раз её средний результат снизился всего на 1,5 балла. Именно это разработчики и обозначают как сохранение 98,2% результата исходной модели.На отдельных задачах разница может быть больше или меньше, поэтому 98,2% – это усреднённый показатель по набору тестов PrismML, а не гарантия одинакового качества во всех сценариях.
🔻 Практический смысл
Главное достижение Bonsai 2 – возможность разместить 27-миллиардную модель примерно в 6 Гбайт весов.
На системе с 16 Гбайт видеопамяти это оставляет существенно больше ресурсов под KV-кэш, длинный контекст, изображения, документы и работу инструментов.
Есть и важное ограничение: Bonsai 2 пока требует специальной версии llama.cpp от PrismML. Стандартный llama.cpp напрямую эти форматы не поддерживает.
🔵 Bonsai 2 показывает, насколько быстро меняются требования к локальным ИИ-моделям. Если раньше 6–8 Гбайт памяти обычно означали модели класса 7–14B, то теперь в тот же диапазон удаётся поместить полноценную Qwen3.8-27B с поддержкой изображений и инструментов.
Post #1848
200
