💻 BONSAI 2 27B: 27 ярда в 6 гигах
короче prismml выкатили Ternary Bonsai 2 27B. это не очередной qwen в q4, а ternary веса {-1, 0, +1}, файл PTQ1_0 на 5.95 GB. база Qwen3.8-27B, контекст до 262k, apache.
заявляют 98.2% от fp16. по факту на 4060 8gb: генерация ~25 tok/s, промпт ~98 t/s. для 27b в ноуте вообще не стыдно
важное: стоковые ollama / lm studio / llama.cpp эту хуйню не едят. типы PTQ1_0 и PQ2_0 только в форке PrismML, без него либо отказ, либо бред.
что качать:
🔵 модель https://huggingface.co/prism-ml/Ternary-Bonsai-2-27B-gguf
файл Ternary-Bonsai-2-27B-PTQ1_0.gguf, он меньше и для 8gb vram правильный выбор
🔵 форк https://github.com/PrismML-Eng/llama.cpp/releases
windows+cuda 12.4, рядом zip с cudart, без dll exe молча дохнет
🔵 гайд https://github.com/PrismML-Eng/Bonsai-demo
сервер с чатом в браузере:
llama-server.exe -m модель.gguf -ngl 99 -c 8192 --parallel 1 --port 8080
потом http://127.0.0.1:8080
без отказов: не официалка, а комьюнити. спокойнее BoldingBuilds Abliterated PTQ1_0, тот же размер и тот же форк. умнее стока не станет, просто меньше «я не могу»
Post #3543
313
- 👍 5