TGViewer
KRUHLYK 🇺🇦 KRUHLYK 🇺🇦 @lets_code_ua · 1.33K subscribers
Post #1560 1.23K
"Подумай довше" не завжди означає "зроби краще"

Логіка ніби очевидна: більше reasoning effort — краща відповідь. Так і рекламують. І в більшості задач це правда працює.

Але є дослідження FutureSearch, де топові моделі прогнали через Deep Research Bench на різних рівнях effort. Результат неприємний: у трьох моделей з чотирьох high effort дав такий самий або гірший результат, ніж low. При цьому в рази дорожче.

Що там насправді відбувається

Модель не витрачає зайвий бюджет розумно. Вона:

- починає сумніватись у вже правильній відповіді
- тягне з собою дедалі маячніші джерела
- застережує там, де і так все очевидно

Простими словами: чим довше вона думає, тим більше знаходить приводів собі не довіряти.

Те саме і в агентних задачах

На SWE-bench помітили той самий патерн у reasoning-моделей: замість того щоб перевірити щось на практиці, модель нескінченно розмірковує. Або починає робити зайві дії "про всяк випадок". Або занадто рано здається, вирішивши, що задача нерозв'язна.

І це сильніше саме у моделей з великим бюджетом мислення, а не у звичайних.

Чому це не просто цікавинка

Якщо ганяєте агентів у роботі — точно бачили, як модель на максимальному thinking раптом починає перевіряти нешкідливий код так, ніби там підступ. Тепер є пояснення чому.

Висновок простий: максимальний effort не дорівнює максимальна якість. Іноді розумніше — це коротше.

А у вас таке ловилось на high effort? Діліться в коментах.
  • ❤ 10
  • 👍 5
  • 🤔 2
More from @lets_code_ua
  1. Oct 3, 2026Мало хто з вас знає, що за освітою я юрист-міжнародник. Магістр міжнародного комерційного…
  2. Oct 2, 2026Там вчора в нашому чаті були дискусії за можливості LLMок в архітектуру. Сьогодні в рамках…
  3. Oct 2, 2026Підтримую! Створюємо петицію?
  4. Oct 2, 2026Пʼятниця ніфіга не пʼятниця сьогодні.
  5. Oct 2, 2026Anthropic завіз моди в Claude Code. Це TypeScript функції, які чіпляються на будь-яку поді…
  6. Oct 1, 2026Post #1709
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →