"Подумай довше" не завжди означає "зроби краще"
Логіка ніби очевидна: більше reasoning effort — краща відповідь. Так і рекламують. І в більшості задач це правда працює.
Але є дослідження FutureSearch, де топові моделі прогнали через Deep Research Bench на різних рівнях effort. Результат неприємний: у трьох моделей з чотирьох high effort дав такий самий або гірший результат, ніж low. При цьому в рази дорожче.
Що там насправді відбувається
Модель не витрачає зайвий бюджет розумно. Вона:
- починає сумніватись у вже правильній відповіді
- тягне з собою дедалі маячніші джерела
- застережує там, де і так все очевидно
Простими словами: чим довше вона думає, тим більше знаходить приводів собі не довіряти.
Те саме і в агентних задачах
На SWE-bench помітили той самий патерн у reasoning-моделей: замість того щоб перевірити щось на практиці, модель нескінченно розмірковує. Або починає робити зайві дії "про всяк випадок". Або занадто рано здається, вирішивши, що задача нерозв'язна.
І це сильніше саме у моделей з великим бюджетом мислення, а не у звичайних.
Чому це не просто цікавинка
Якщо ганяєте агентів у роботі — точно бачили, як модель на максимальному thinking раптом починає перевіряти нешкідливий код так, ніби там підступ. Тепер є пояснення чому.
Висновок простий: максимальний effort не дорівнює максимальна якість. Іноді розумніше — це коротше.
А у вас таке ловилось на high effort? Діліться в коментах.
Post #1560
1.23K
- ❤ 10
- 👍 5
- 🤔 2