Портировал 2.4-битную Qwen3.8-27B от Mirai в llama.cpp. Теперь она влезает в видеокарту на 12 ГБ со 128K контекста.
Одна RTX 3090 при 300 Вт, в пределах 12 ГБ:
128K с q4 KV: 11.3 ГБ
74K с q8 KV: 11.1 ГБ
decode 40 т/с, на 62K около 35 т/с
prefill около 1000 т/с
на 16 ГБ влезает 128K с MTP: 85 т/с на коде
Веса не переквантованы: сжатые коды Mirai лежат в GGUF бит в бит, и greedy-вывод совпадает с их плагином для vLLM. Vision модуль Mirai не выпустили, поэтому я собрал mmproj из базовой Qwen3.8 и запускаем его на CPU, видеопамять он не ест.
Заодно ускорил длинный контекст в самой llama.cpp: decode на 64K вырос с 27.9 до 35.2 т/с, prefill на 11%. Место для оптимизации еще есть.
По AppWorld от Mirai модель на 2.4 битах решает 57.9% задач, полная bf16 55.8%. На видео то, что она собрала сама как агент (тот прогон шёл через vLLM и на чистом pi.dev).
Код: github.com/alesha-pro/llama.cpp-mirai-s
Веса: huggingface.co/alesha-pro/Qwen3.8-27B-S-mirai-GGUF
PS: Pagoda Garden на видео моргает - это баг съемки Astra, я его не заметил. В последнем видосе полоски сквозь экран - это да, косяк кода LLM, а моргание - нет.
Post #668
23
Forwarded from Фарш не провернуть 💝