TGViewer
Synaptic Garden Synaptic Garden @synaptic_garden · 534 subscribers
Post #1332 204
PrismML ужала Qwen3.8 27B до 5,9 ГБ с трёхзначными весами

PrismML выпустила Ternary Bonsai 2 27B — новую версию своей сверхнизкобитной локальной модели на базе Qwen3.8 27B. Вместо обычных 16-битных весов здесь используются всего три значения: −1, 0 и +1, дополненные групповым масштабированием FP16. В результате эффективная точность составляет около 1,76 бита на вес, а языковая часть модели занимает 5,9 ГБ вместо примерно 54 ГБ у FP16-версии. Контекст — до 262 тысяч токенов, модель умеет работать с изображениями и выпущена под Apache 2.0.

Главный результат PrismML — качество при столь агрессивном сжатии. На наборе из 20 тестов по математике, программированию, рассуждениям, следованию инструкциям, зрению и работе с инструментами Bonsai 2 набрала 83,9 балла против 85,4 у исходной Qwen3.8 27B. Компания называет это сохранением 98,2% качества. Особенно небольшой разрыв заявлен в математике и обычных задачах программирования. Для сравнения, традиционная двухбитная квантизация той же модели, по тестам PrismML, деградирует заметно сильнее.

Но у цифры 98,2% есть важная оговорка. Она относится к усреднённому набору тестов и не включает некоторые наиболее тяжёлые агентные сценарии. На Terminal-Bench 2.1 Bonsai 2 получила 52,8 против 69,7 у полной модели, а на SWE-bench Verified — 60,8 против 80,6. То есть в длительных цепочках действий и автономной разработке сохраняется уже около трёх четвертей результата исходной модели. Пока это в основном собственные измерения PrismML, полноценного независимого воспроизведения результатов ещё нет.

Зато требования к железу действительно необычные для модели такого размера. PrismML заявляет до 143 токенов/с на RTX 5090 и около 47 токенов/с на M5 Max. Уже появились и пользовательские тесты: Bonsai 2 удалось запустить даже на 8-гигабайтном M2 Mac mini с сильно ограниченным запасом памяти, а владельцы дискретных GPU сообщают о десятках токенов в секунду. Это пока скорее первые практические наблюдения, чем систематические тесты.

Технически 5,9 ГБ — это только плотно упакованные языковые веса GGUF: для мультимодальности отдельно нужен vision-модуль примерно на 0,6–0,9 ГБ. Есть также более быстрый вариант упаковки на 7,2 ГБ и MLX-версия для Apple Silicon размером 8,6 ГБ вместе с визуальной частью. Кроме того, низкобитные форматы Bonsai 2 пока требуют специальных ядер PrismML и их сборки llama.cpp, так что это ещё не совсем модель из категории «скачал любой GGUF и запустил где угодно».

Если заявленные результаты подтвердятся независимыми тестами, Bonsai 2 интересна прежде всего не как замена облачным фронтирным моделям, а как демонстрация того, насколько далеко можно сжать достаточно сильную 27B-модель. По сути, PrismML пытается получить качество крупной локальной модели в объёме памяти, который ещё недавно был территорией моделей на 7–8 млрд параметров.
  • 👍 1
  • 🔥 1
More from @synaptic_garden
  1. Sep 21, 2026SpaceXAI представила Grok 4.7 — флагманскую модель, ориентированную на задачи программиров…
  2. Sep 21, 2026Появился сайт, на котором приведены ссылки на множество примеров использования Jev: https:…
  3. Sep 20, 2026Команда Qwen опубликовала веса Qwen-Image-2.1 — новой модели, которая объединяет генерацию…
  4. Sep 20, 2026photo post
  5. Sep 20, 2026Step 5 Preview — 600 млрд параметров и ставка на долгоживущих агентов Китайская StepFun пр…
  6. Sep 19, 2026Бесплатный доступ к Jev через лист ожидания можно получить на сайте непосредственно вендор…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →