Swift-Qwen3.8-27B от UkisAI это та же Qwen3.8-27B, только думает вдвое короче. LoRA-адаптер срезает медианную длину рассуждений на 58% при потере меньше 1% качества, на практике это ускорение в 1,95 раза. На LiveCodeBench v6 результат даже вырос с 76,8 до 81,6 при экономии токенов в 24%, а вот AIME 2026 просел с 98,7 до 94,0.
Рецепт такой: авторы нашли токены-маркеры, которые запускают у Qwen переобдумывание, и дообучили модель со штрафом за них. Экономия держится на всех уровнях reasoning_effort, от low до xhigh.
Лицензия своя: бесплатно для любого использования, пока годовая выручка меньше $1 млн, выше нужна корпоративная. GGUF для llama.cpp лежит отдельно, его уже скачали 55 тысяч раз. На видео параллельный прогон задачи из LiveCodeBench: база против Swift.
@neuro_channel
Post #2895
1.89K
- ❤ 3