Я закончил с Bonsai 2 27B от PrismML, которая сохраняет 98% качества Qwen3.8 при сжатии примерно в 9 раз 🤡
Их обидчивый DevRel скинул мне ПРАВИЛЬНЫЕ настройки и я с ними немного позапускал.
Прогнал 12 сессий: Q2 и Q1, 3 варианта KV-кеша, 2 промпта. Контекст 128K. Харнессом был omp как всегда
Была обычная пагода - промпт попроще и посложнее соответственно ☺️
С простым промптом сцена отрисовалась в 5 случаях из 6. С тем что посложнее пригодный результат получился в 3 из 6. Самый долгий прогон потратил почти 5 часов и 418 тысяч токенов на пустое небо. Вырубил нахрен.
Всё на видиках. По одному запуску на конфигурацию, поэтому выводов уровня Q8 умнее FP16 тут не будет.
По памяти тоже посмотрел:
• 8 GB: для 64K приходится брать PTQ1_0, Q4 KV и переносить vision на CPU.
• 12 GB: 128K с Q4 KV помещается у обеих упаковок.
• 16 GB: 128K с Q8 KV помещается у обеих.
На карточке подробнее. Это плюс минус ориентир по выделенной памяти. Загрузку с 4K контекста за нормальную работу агента я не считаю.
Для своего размера модель сносная. PrismML ни в коем случае не оправданы. Скорее наоборот. С таким подходом к взаимодействию с комунити удачи им.
Короче на этом всё. Пользуйтесь, на здоровье, если вам подходит. С меня хватит.
Post #624
19
Forwarded from Фарш не провернуть 💝