TGViewer
❝[Консенсус Тьюринга]❞ ❝[Консенсус Тьюринга]❞ @turing_consensus · 704 subscribers
Post #811 131
Иллюзия мышления:
"Понимание сильных и слабых сторон "reasoning models" сквозь призму сложности проблемы".

Отчет с таким захватывающим названием выпустила на днях 🍏 Apple:

🖥 ПОЛНЫЙ ТЕКСТ

Коротко о главном:

🧠 Иллюзия мышления: почему «думающие» ИИ-модели на самом деле не умеют думать

Передовые языковые модели нового поколения — такие как Claude 3.7 Thinking, DeepSeek-R1 и OpenAI o3, — позиционируются как Large Reasoning Models (LRM), то есть модели, способные к логическому рассуждению. Они используют длинные цепочки размышлений (Chain-of-Thought), умеют проверять себя сами и демонстрируют успехи в задачах, где требуется глубокое логическое мышление. Но действительно ли они умеют думать?

Исследование Apple и авторов отчёта The Illusion of Thinking показывает: 👎. Или, по крайней мере, пока — с большими оговорками.

👀 Как проводилось исследование?

Вместо традиционных математических задач (которые могут быть «засорены» обучающими данными) исследователи использовали четыре классические логические головоломки с настраиваемой сложностью:

➡️ Башня Ханоя
➡️ Прыгающие шашки
➡️ Переправа через реку
➡️ Перестановка блоков

Каждую задачу можно «усложнять», изменяя число элементов, но сохраняя структуру. Это позволило изучать не только точность финальных ответов, но и качество промежуточных размышлений.

🧮 Результаты: три режима мышления

Исследование выявило три режима поведения reasoning-моделей:

⭐️ Низкая сложность: базовые LLM (без мышления) справляются лучше, быстрее и с меньшими затратами токенов.

⭐️⭐️ Средняя сложность: модели с Chain-of-Thought начинают показывать преимущества, но платить за это приходится существенным ростом токенов и времени.

⭐️⭐️⭐️ Высокая сложность: все модели терпят крах. Неважно, думает ли модель или нет — точность падает до нуля, reasoning «разваливается».

🎩 Иллюзия мышления: почему это происходит?

Авторы обнаружили парадокс: по мере роста сложности модели сначала увеличивают «объём размышлений» (число токенов в reasoning), но затем начинают думать меньше. Причём это никак не связано с нехваткой токенов - их было в избытке. Это говорит скорее о внутреннем лимите на масштабируемость мышления.

Также выяснилось, что:

Модели склонны к overthinking (излишние размышления): находят правильное решение, но продолжают перебирать ложные варианты.

На сложных задачах перестаёт работать самопроверка — модели зацикливаются на неправильных ходах.

Даже при наличии алгоритма в промпте (например, для Башен Ханоя) модели всё равно совершают ошибки, что ставит под сомнение их способность к пошаговому выполнению логических процедур.

📊 Немного статистики

В задачах вроде Tower of Hanoi: Claude 3.7 Thinking способен делать 100+ правильных ходов на N=10, прежде чем ошибиться.
В River Crossing на N=3 — провал уже на 4м шаге. Это, скорее всего, связано с тем, что таких задач было мало в обучающей выборке.

Интересно: точность решений не обязательно улучшается с количеством размышлений. Иногда наоборот — чем дальше думает модель, тем хуже становится результат.

Что это означает ❓

Модели действительно учатся размышлять — но их reasoning достаточно сильно ограничен масштабируемостью. Они не всегда умеют точно выполнять даже предложенный алгоритм, а их «мышление», зачастую, просто напоминает длинную генерацию, нежели полноценную стратегию

Это поднимает важный вопрос: не переоцениваем ли мы прогресс в ИИ-рассуждениях?

What's next ❓

Исследование показывает, что нам нужны:

1️⃣ более контролируемые среды оценки, а не только математические тесты
2️⃣ анализ reasoning feed, а не только финальных ответов.
3️⃣ более эффективные механизмы самопроверки, особенно на высокой сложности.
4️⃣ новые архитектурные решения, исправляющие эффект «разрушения мышления».

ИИ может и «делает вид», что думает — но пока это, во многом, иллюзия.
Понимание пределов этого «мышления» — ключ к следующему скачку в развитии LLM.


🤓 Crypto Hustlers | 💬Chat | 📹 YouTube | 💱 Наша обменка
More from @turing_consensus
  1. Sep 27, 2026💀 Биткоин превращается в скучный актив Полгода назад глава аналитической CryptoQuant Ки Ё…
  2. Sep 26, 2026💀 Bitget взломали на $352 млн — и заморозили выводы 24 сентября биржа подтвердила: из гор…
  3. Sep 25, 2026🤖 Зачем OpenAI и Anthropic вдруг захотели притормозить ИИ — версия Артура Хейса Артур Хей…
  4. Sep 24, 2026💵 ИИ всё ещё не умеет считать деньги: 57% ошибок Британский финтех Saturn прогнал 18 моде…
  5. Sep 23, 2026🪙 Легальная крипта в России: сколько стоит вход в белую зону До конца года в РФ должен за…
  6. Sep 22, 2026💵 Apple и Google ищут людей под стейблкоины Крипто-каналы преподносят это как «стейблы за…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →