Bonsai 2 27B - сжатая Qwen3.8-27B, которая занимает 5,9 ГБ против примерно 54 ГБ у исходной модели в FP16 и сохраняет 98,2% её среднего результата на бенчмарках.
Prism ML - американский стартап из команды Калтеха, вышедший из стелс-ркжима весной 2026 года с анонсом первой версии моделей Bonsai.
Основатель и руководитель - профессор Калтеха Бабак Хассиби, специалист по теории сжатия. Среди инвесторов стартапа Cerberus, Google и Samsung.
Модель рассчитана на локальный запуск на потребительском оборудовании, имеет контекст в 262 тысячи токенов и может обрабатывать изображения и вызывать инструменты.
Целевые сценарии - агенты в редакторе кода, работа с компьютером, разбор документов без отправки их в облако.
Вес в тернарном квантовании хранится не числом, а одним из трёх знаков: минус, ноль или плюс. Сами величины задаются отдельно - веса разбиты на группы по 128, и у каждой группы один общий множитель в FP16.
В пересчёте на один вес это 1,72 бита против 16 у исходной модели. Перед сжатием веса каждой матрицы разворачивают фиксированным преобразованием Адамара, сам разворот вписан в веса, но при работе его нужно повторить на входных данных, иначе модель выдаёт бессмыслицу.
Распознавание картинок сжатие не проходило, лежит отдельным файлом на 0,6 ГБ и подгружается только тогда, когда на вход пришло изображение, так что текстовые задачи его не задействуют.
🟡В релизе три варианта
🟢GGUF в двух упаковках: PTQ1_0 (1,75 бита, 5,95 ГБ, быстрее на картах Ada и L4) и PQ2_0 (2,13 бита, 7,21 ГБ, быстрее на H100 и Blackwell);
🟢сборка под MLX на 8,60 ГБ вместе со зрением;
🟠тестовая упаковка Q2_0 для доработки ядер.
Для GGUF нужен специальный форк llama.cpp от Prism ML, для MLX - загрузчик из самого пакета.
🟡Бенчмарки
Замеры Prism ML считали через EvalScope и vLLM на H100, в режиме рассуждения, всего провели 14 тестов. Сравнивали со сборки той же Qwen3.8-27B в квантованиях UD-Q4_K_XL и IQ2_XXS.
Среднее по всем тестам: 84,78 против 86,32 у FP16 и 72,59 у IQ2_XXS. До четырёхбитной сборки не хватило 0,4 пункта при втрое меньшем размере.
AIME26: 95,83 против 94,58 у FP16 и 57,50 у IQ2_XXS.
LiveCodeBench: 90,07 против 90,05 и 56,40 соответственно.
BFCL v3 (вызов инструментов): 74,92 против 76,74 у FP16.
MMMU-Pro: 75,49 против 81,73.
Скорость генерации на RTX 5090 примерно 129 токенов в секунду, на ноутбучном M5 Pro - 28 токенов в секунду.
📌Лицензирование: Apache 2.0
🟡Блогпост
🟡Веса
🟡Техотчет
🟡Демо на WebGPU
🟡Сообщество в Discord
🖥GitHub
@ai_machinelearning_big_data
#AI #ML #LLM #Bonsai #PrizmML