"Понимание сильных и слабых сторон "reasoning models" сквозь призму сложности проблемы".
Отчет с таким захватывающим названием выпустила на днях 🍏 Apple:
🖥 ПОЛНЫЙ ТЕКСТ
Коротко о главном:
🧠 Иллюзия мышления: почему «думающие» ИИ-модели на самом деле не умеют думать
Передовые языковые модели нового поколения — такие как Claude 3.7 Thinking, DeepSeek-R1 и OpenAI o3, — позиционируются как Large Reasoning Models (LRM), то есть модели, способные к логическому рассуждению. Они используют длинные цепочки размышлений (Chain-of-Thought), умеют проверять себя сами и демонстрируют успехи в задачах, где требуется глубокое логическое мышление. Но действительно ли они умеют думать?
Исследование Apple и авторов отчёта The Illusion of Thinking показывает: 👎. Или, по крайней мере, пока — с большими оговорками.
👀 Как проводилось исследование?
Вместо традиционных математических задач (которые могут быть «засорены» обучающими данными) исследователи использовали четыре классические логические головоломки с настраиваемой сложностью:
➡️ Башня Ханоя
➡️ Прыгающие шашки
➡️ Переправа через реку
➡️ Перестановка блоков
Каждую задачу можно «усложнять», изменяя число элементов, но сохраняя структуру. Это позволило изучать не только точность финальных ответов, но и качество промежуточных размышлений.
🧮 Результаты: три режима мышления
Исследование выявило три режима поведения reasoning-моделей:
⭐️ Низкая сложность: базовые LLM (без мышления) справляются лучше, быстрее и с меньшими затратами токенов.
⭐️⭐️ Средняя сложность: модели с Chain-of-Thought начинают показывать преимущества, но платить за это приходится существенным ростом токенов и времени.
⭐️⭐️⭐️ Высокая сложность: все модели терпят крах. Неважно, думает ли модель или нет — точность падает до нуля, reasoning «разваливается».
🎩 Иллюзия мышления: почему это происходит?
Авторы обнаружили парадокс: по мере роста сложности модели сначала увеличивают «объём размышлений» (число токенов в reasoning), но затем начинают думать меньше. Причём это никак не связано с нехваткой токенов - их было в избытке. Это говорит скорее о внутреннем лимите на масштабируемость мышления.
Также выяснилось, что:
Модели склонны к overthinking (излишние размышления): находят правильное решение, но продолжают перебирать ложные варианты.
На сложных задачах перестаёт работать самопроверка — модели зацикливаются на неправильных ходах.
Даже при наличии алгоритма в промпте (например, для Башен Ханоя) модели всё равно совершают ошибки, что ставит под сомнение их способность к пошаговому выполнению логических процедур.
📊 Немного статистики
В задачах вроде Tower of Hanoi: Claude 3.7 Thinking способен делать 100+ правильных ходов на N=10, прежде чем ошибиться.
В River Crossing на N=3 — провал уже на 4м шаге. Это, скорее всего, связано с тем, что таких задач было мало в обучающей выборке.
Интересно: точность решений не обязательно улучшается с количеством размышлений. Иногда наоборот — чем дальше думает модель, тем хуже становится результат.
Что это означает ❓
Модели действительно учатся размышлять — но их reasoning достаточно сильно ограничен масштабируемостью. Они не всегда умеют точно выполнять даже предложенный алгоритм, а их «мышление», зачастую, просто напоминает длинную генерацию, нежели полноценную стратегию
Это поднимает важный вопрос: не переоцениваем ли мы прогресс в ИИ-рассуждениях?
What's next ❓
Исследование показывает, что нам нужны:
1️⃣ более контролируемые среды оценки, а не только математические тесты
2️⃣ анализ reasoning feed, а не только финальных ответов.
3️⃣ более эффективные механизмы самопроверки, особенно на высокой сложности.
4️⃣ новые архитектурные решения, исправляющие эффект «разрушения мышления».
ИИ может и «делает вид», что думает — но пока это, во многом, иллюзия.
Понимание пределов этого «мышления» — ключ к следующему скачку в развитии LLM.
🤓 Crypto Hustlers | 💬Chat | 📹 YouTube | 💱 Наша обменка
