DavidAU выложил необычный fine-tune Qwen3.5-9B с упором на reasoning, код, creative writing и жёсткое следование инструкциям. Модель помечена как multi-stage tuned, heretic/abliterated и распространяется под Apache 2.0.
Самое интересное в цифрах. Автор утверждает, что в своём наборе из семи бенчмарков 9B-версия превосходит обычную Qwen3.5-27B и Qwen3.6-35B-A3B, а в отдельных тестах добирается до уровня Qwen3.6-27B. Это пока результаты из model card, поэтому воспринимать их лучше как заявленные, а не как независимый leaderboard.
Для локального запуска подготовили обычные и MTP GGUF в куче квантов. Например, Q4_K_M занимает около 6,83 ГБ, а MTP-версия около 6,98 ГБ. Есть варианты от IQ2_M примерно на 4,94 ГБ до Q8_0 около 10,5–10,7 ГБ.
Отдельно используется NEO IMATRIX. По заявлению автора, такой способ квантования должен лучше сохранять качество и long-context поведение по сравнению с обычными GGUF.
Запускается через llama.cpp, Ollama, vLLM, LM Studio и другие локальные рантаймы; через llama.cpp можно сразу поднять OpenAI-compatible endpoint.
Если заявленные результаты подтвердятся на независимых тестах, это ещё один хороший пример того, насколько далеко сейчас можно вытянуть маленькую 9B-модель правильным fine-tuning + quantization.
DavidAU/Qwen3.5-9B-The-Defiant-Fable-Uncensored-Heretic-NEO-IMATRIX-MAX-MTP-GGUF#AI #LLM #Qwen #LocalAI #GGUF