TGViewer
Neurohive Neurohive @neurohive · 5.16K subscribers
Post #1966 4.58K
🗜Bonsai: 1-bit версия Qwen 27B работает на iPhone c сохранением 90% качества ответов

Стартап PrismML выпустил Bonsai 27B — бинарную и тернарную версии Qwen3.6-27B, которые сохраняют 90–95% качества исходной модели при сжатии весов в 9.4–14.2 раза. Тернарная версия занимает 5.9 ГБ и работает на ноутбуке (M5 Pro) со скоростью около 26 токенов в секунду, а 1-битная умещается в 3.9 ГБ и генерирует около 11 токенов в секунду на iPhone 17 Pro Max, или около 30 слов в секунду. Это первый случай, когда модель такого класса запускается на телефоне.

Обычное квантование ниже 4–5 бит ломает модели резко, а не постепенно. Текст остаётся гладким и уверенным, но рассуждения начинают противоречить сами себе, вызовы инструментов перестают парситься. До сих пор это обходили только обучением с нуля сразу в низкобитном виде (подход BitNet от Microsoft), но такие модели упёрлись в ~2B параметров. Bonsai конвертирует уже готовую предобученную модель, и главный результат именно в этом: считалось, что при сжатии ниже 4 бит модели ломаются сами по себе, но выяснилось, что дело в методах квантования.

Тернарный значит «троичный». Это способ хранения весов, при котором каждый вес принимает только одно из трёх значений: −1, 0 или +1. В обычной модели каждый вес — это число с плавающей точкой (FP16), например 0.0374, и на него уходит 16 бит. В бинарной модели вес может быть только −1 или +1, то есть хранится один бит, по сути только знак. Ноль здесь важен, потому что даёт модели возможность «выключить» связь между нейронами, то есть сказать «этот вход вообще не влияет на выход». Тернарная версия точнее, а бинарная компактнее.

Усредненные показатели по 15 бенчмаркам от математики и кода до вызова инструментов и работы с изображениями показывают, что деградация ответов по сравнению с исходной Qwen3.6-27B составляет 5.4% у Ternary Bonsai - 80,49 пртив 85.07 и 11.5% у 1-bit Bonsai, которая показала средний бал 76.11. Сравнение проводилось по единой методике на базе EvalScope с vLLM на NVIDIA H100 в режиме рассуждений, где деградация ниже 4 бит проявляется сильнее всего. Тернарная и бинарная версии теряют заметные баллы на агентных задачах и зрении относительно FP16.

Веса обеих версий выложены на Hugging Face, код на GitHub под лицензией Apache 2.0, а попробовать модель можно в браузере.

#Stateoftheart
  • ❤ 9
  • 👍 7
  • 🔥 5
  • 👏 2
More from @neurohive
  1. Sep 24, 2026RRSI: метод рекурсивного самоулучшения обвязки ИИ-агентов от Google улучшил результаты Cla…
  2. Sep 19, 2026Vidu S2: модель генерирует видео-аватары и редактирует стримы на лету в 720p при 25–42 FPS…
  3. Sep 9, 2026WorldSculpt: модель собирает 3D-сцену с сотнями отдельных объектов из видео Alaya Lab и То…
  4. Aug 31, 2026🗣 VoiceMem: фреймворк памяти для голосовых ассистентов поднимает факты из всех прошлых ди…
  5. Aug 24, 20264DAnyone: 4D-модель человека из видео, снятого одной камерой Исследователи из Zhejiang Uni…
  6. Aug 11, 2026JoyAI-Video-Edit: 16B-модель редактирует видео в реальном времени при 30 FPS в 720p на одн…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →