Совет по глубине рассуждения агента ничего не стоит без вашей задачи. В этой истории таких советов три, и смотрят они в разные стороны.
Саймон Уиллисон прогнал вышедшую в пятницу Qwen 3.8 27B — 27 миллиардов параметров, лицензия Apache 2, квант на 17 гигабайт — локально на MacBook Pro M5 Max и NVIDIA DGX Spark. Рисунок в SVG занял 21 минуту: 22 276 токенов рассуждения ради 3 223 токенов вывода. Тот же промпт с выключенным рассуждением — 137 секунд.
— Карточка модели ставит дефолтом самый глубокий из трёх уровней, xhigh, «for complex tasks demanding thorough analysis».
— Уиллисон про свой же лучший результат: «Was that worth waiting 21 minutes for? Absolutely not», и дальше — игнорируйте дефолт, начинайте с low или вовсе без рассуждения.
— Та же карточка ниже предупреждает об обратном: в многоходовых агентных задачах пониженный reasoning effort не всегда сокращает общее время, потому что даёт меньше анализа, больше провалов и повторных попыток.
— В треде на Hacker News советуют третье: не low, а medium и окно побольше, иначе модель упирается в компакцию и передумывает одно и то же по кругу.
И вот тут начинается то, ради чего я притащил историю. Все три совета верны — просто каждый про свою задачу. Уиллисон мерил рисунок пеликана. Человек под ником SwellJoe мерил свой пул-реквест: одиннадцать часов на паре видеокарт, «default everything, no tuning», при том что GPT 5.5 сделала похожую задачу у него примерно за двадцать минут. Карточка говорит про многоходовые агентные прогоны вообще и не даёт ни одного числа. Три задачи — три ответа, и ни один из них не про вашу.
Эта же ручка есть и у вас: в агенте, в клиенте локальной модели или в параметрах вызова API. И вы, скорее всего, не трогали её ни разу, потому что непонятно, в какую сторону.
Что сделать сегодня. Взять не бенчмарк, а свою типовую задачу и прогнать её дважды: на дефолте и уровнем ниже. Признак, по которому решать, — не секунды, а сколько раз пришлось переспрашивать. У Уиллисона на быстрой настройке инструмент почти заработал: «nearly works but shows the boxes in the wrong place».
Честности ради, SwellJoe в следующей же фразе объясняет, что дело не только в дефолте: другие мелкие модели на своих настройках укладывались в пару часов, «but did a worse job». Да и главный вывод самого Уиллисона не про глубину — ежедневным инструментом модель не даёт стать сырая скорость, 15–30 токенов в секунду на дорогом железе.
https://simonwillison.net/2026/Aug/16/qwen-38-27b/
Какой уровень рассуждения стоит по умолчанию в том агенте, которым вы вчера пользовались чаще всего?
Post #850
287