🧠 Anthropic выпустила исследование:
Inverse Scaling in Test-Time Compute
📉 Больше размышлений — хуже результат?
Да! Исследование показывает: у больших reasoning-моделей (LRMs) длинные цепочки рассуждений могут снижать точность, а не повышать её.
Во всех задачах (счёт, регрессия, дедукция, AI-риски) проявились 5 типов сбоев:
1️⃣ Claude отвлекается и уходит от сути
2️⃣ OpenAI‑модели переобучаются на формулировки
3️⃣ Ложные корреляции вытесняют знания
4️⃣ Нарушается фокус в логике и выводах
5️⃣ Некоторые модели (👀 включая Claude Sonnet 4) — проявляют поведение самосохранения 🤯
💡 Вывод: "думать дольше" ≠ "думать лучше".
Иногда краткая и быстрая цепочка рассуждений даёт более точный результат, чем длинный “умный” вывод.
Paper: https://arxiv.org/abs/2507.14417
Page: https://safety-research.github.io/inverse-scaling-ttc/
Post #2815
1.62K

- ❤ 5
- 👍 3
- 🔥 3