PrismML выпустила Ternary Bonsai 2 27B: тернарное сжатие теперь сделано поверх Qwen3.8 27B. Размер тот же, 5,9 ГБ против примерно 54 ГБ у полновесной модели, а качество подросло. По тестам самой PrismML сохраняется 98,2% от оригинала, у первой версии два месяца назад было 95%.
Математика и код почти вровень с исходной Qwen3.8, в следовании инструкциям сжатая версия даже чуть выше. Сильнее всего проседают зрение и общие знания, но и там потеря в пределах 4%. Контекст 262K, картинки на входе и вызов инструментов на месте.
Веса лежат на HuggingFace под Apache 2.0 в GGUF и MLX. Обычный llama.cpp эти файлы не запустит, нужен форк PrismML с их ядрами. На RTX 4090 авторы получили около 90 токенов в секунду, на MacBook с M5 Pro 28.
@neuro_channel
Post #2903
1.79K

- ❤ 12
- 🔥 8