TGViewer
КайфКодинг КайфКодинг @vibecodingartem · 1.01K subscribers
Post #850 287
Совет по глубине рассуждения агента ничего не стоит без вашей задачи. В этой истории таких советов три, и смотрят они в разные стороны.

Саймон Уиллисон прогнал вышедшую в пятницу Qwen 3.8 27B — 27 миллиардов параметров, лицензия Apache 2, квант на 17 гигабайт — локально на MacBook Pro M5 Max и NVIDIA DGX Spark. Рисунок в SVG занял 21 минуту: 22 276 токенов рассуждения ради 3 223 токенов вывода. Тот же промпт с выключенным рассуждением — 137 секунд.

— Карточка модели ставит дефолтом самый глубокий из трёх уровней, xhigh, «for complex tasks demanding thorough analysis».

— Уиллисон про свой же лучший результат: «Was that worth waiting 21 minutes for? Absolutely not», и дальше — игнорируйте дефолт, начинайте с low или вовсе без рассуждения.

— Та же карточка ниже предупреждает об обратном: в многоходовых агентных задачах пониженный reasoning effort не всегда сокращает общее время, потому что даёт меньше анализа, больше провалов и повторных попыток.

— В треде на Hacker News советуют третье: не low, а medium и окно побольше, иначе модель упирается в компакцию и передумывает одно и то же по кругу.

И вот тут начинается то, ради чего я притащил историю. Все три совета верны — просто каждый про свою задачу. Уиллисон мерил рисунок пеликана. Человек под ником SwellJoe мерил свой пул-реквест: одиннадцать часов на паре видеокарт, «default everything, no tuning», при том что GPT 5.5 сделала похожую задачу у него примерно за двадцать минут. Карточка говорит про многоходовые агентные прогоны вообще и не даёт ни одного числа. Три задачи — три ответа, и ни один из них не про вашу.

Эта же ручка есть и у вас: в агенте, в клиенте локальной модели или в параметрах вызова API. И вы, скорее всего, не трогали её ни разу, потому что непонятно, в какую сторону.

Что сделать сегодня. Взять не бенчмарк, а свою типовую задачу и прогнать её дважды: на дефолте и уровнем ниже. Признак, по которому решать, — не секунды, а сколько раз пришлось переспрашивать. У Уиллисона на быстрой настройке инструмент почти заработал: «nearly works but shows the boxes in the wrong place».

Честности ради, SwellJoe в следующей же фразе объясняет, что дело не только в дефолте: другие мелкие модели на своих настройках укладывались в пару часов, «but did a worse job». Да и главный вывод самого Уиллисона не про глубину — ежедневным инструментом модель не даёт стать сырая скорость, 15–30 токенов в секунду на дорогом железе.

https://simonwillison.net/2026/Aug/16/qwen-38-27b/

Какой уровень рассуждения стоит по умолчанию в том агенте, которым вы вчера пользовались чаще всего?
Simon Willison’s Weblog Qwen 3.8 27B is excellent, but it defaults to wildly overthinking things Friday’s big release was Qwen 3.8 27B, an Apache 2 licensed 27B parameter vision-capable LLM from Alibaba’s Qwen research lab. I’ve been looking forward to this one: 27B is an …
  • 🔥 1
More from @vibecodingartem
  1. Sep 22, 2026Сегодня ожидаем релиз Claude Opus 5.5 (а с ним, надеюсь, и сброс лимитов) #anthropic@rvnik…
  2. Sep 22, 2026Xiaomi выпустила MiMo V2.6 Pro и Flash с открытыми весами Pro — топ-1 в Artificial Analysi…
  3. Sep 22, 2026МиМо - одна из любимиц пользователей ОпенРоутера. В корпоративном сегменте РФ про нее забы…
  4. Sep 21, 2026🐹 Хомка за полторы недели: семейный ассистент, который помнит всё и не путает, кому что П…
  5. Sep 21, 2026Post #991
  6. Sep 21, 2026"Воскресная Астра". Есть такое выражение - "воскресный папа". Папа приходит на 1 день, вок…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →