PrismML ужала Qwen3.8 27B до 5,9 ГБ с трёхзначными весами
PrismML выпустила Ternary Bonsai 2 27B — новую версию своей сверхнизкобитной локальной модели на базе Qwen3.8 27B. Вместо обычных 16-битных весов здесь используются всего три значения: −1, 0 и +1, дополненные групповым масштабированием FP16. В результате эффективная точность составляет около 1,76 бита на вес, а языковая часть модели занимает 5,9 ГБ вместо примерно 54 ГБ у FP16-версии. Контекст — до 262 тысяч токенов, модель умеет работать с изображениями и выпущена под Apache 2.0.
Главный результат PrismML — качество при столь агрессивном сжатии. На наборе из 20 тестов по математике, программированию, рассуждениям, следованию инструкциям, зрению и работе с инструментами Bonsai 2 набрала 83,9 балла против 85,4 у исходной Qwen3.8 27B. Компания называет это сохранением 98,2% качества. Особенно небольшой разрыв заявлен в математике и обычных задачах программирования. Для сравнения, традиционная двухбитная квантизация той же модели, по тестам PrismML, деградирует заметно сильнее.
Но у цифры 98,2% есть важная оговорка. Она относится к усреднённому набору тестов и не включает некоторые наиболее тяжёлые агентные сценарии. На Terminal-Bench 2.1 Bonsai 2 получила 52,8 против 69,7 у полной модели, а на SWE-bench Verified — 60,8 против 80,6. То есть в длительных цепочках действий и автономной разработке сохраняется уже около трёх четвертей результата исходной модели. Пока это в основном собственные измерения PrismML, полноценного независимого воспроизведения результатов ещё нет.
Зато требования к железу действительно необычные для модели такого размера. PrismML заявляет до 143 токенов/с на RTX 5090 и около 47 токенов/с на M5 Max. Уже появились и пользовательские тесты: Bonsai 2 удалось запустить даже на 8-гигабайтном M2 Mac mini с сильно ограниченным запасом памяти, а владельцы дискретных GPU сообщают о десятках токенов в секунду. Это пока скорее первые практические наблюдения, чем систематические тесты.
Технически 5,9 ГБ — это только плотно упакованные языковые веса GGUF: для мультимодальности отдельно нужен vision-модуль примерно на 0,6–0,9 ГБ. Есть также более быстрый вариант упаковки на 7,2 ГБ и MLX-версия для Apple Silicon размером 8,6 ГБ вместе с визуальной частью. Кроме того, низкобитные форматы Bonsai 2 пока требуют специальных ядер PrismML и их сборки llama.cpp, так что это ещё не совсем модель из категории «скачал любой GGUF и запустил где угодно».
Если заявленные результаты подтвердятся независимыми тестами, Bonsai 2 интересна прежде всего не как замена облачным фронтирным моделям, а как демонстрация того, насколько далеко можно сжать достаточно сильную 27B-модель. По сути, PrismML пытается получить качество крупной локальной модели в объёме памяти, который ещё недавно был территорией моделей на 7–8 млрд параметров.
Post #1332
204

- 👍 1
- 🔥 1