TGViewer
Тест Тьюринга Тест Тьюринга @testuring · 2.13K subscribers
Post #2031 586
🤔 Разум или мираж? Что на самом деле умеют «рассуждающие» нейросети

В мире ИИ новый тренд — «рассуждающие» нейросети (reasoning models). OpenAI o3, GPT-5, DeepSeek R1 и V3.1, Gemini 2.5 Deep Think и другие их преподносят как прорыв, способный не просто генерировать текст, а мыслить. Но так ли это на самом деле?

В августе вышла статья учёных из Университета Аризоны «Is Chain-of-Thought Reasoning of LLMs a Mirage? A Data Distribution Lens». В отличие от большинства тестов, исследователи не просто прогоняли готовые модели по бенчмаркам. Они создали специальную среду DataAlchemy и обучили нейросети с нуля на простых задачах, полностью контролируя процесс. Это позволило исключить влияние скрытых знаний из гигантских датасетов и проверить именно способность к логическому выводу.

Главные выводы исследования:

👉 Столкнувшись с задачами, которые хоть немного отличались от обучающих примеров, точность моделей падала со 100% почти до нуля. Вместо логического вывода они просто пытались воспроизвести знакомые шаблоны.

👉 Модели не могли обобщить рассуждения на цепочки другой длины и «ломались» даже от незначительных изменений в формулировке промпта, например, от вставки «шумовых» слов.

👉 Гипотеза учёных подтвердилась — эффективность модели напрямую зависит от того, насколько тестовая задача похожа на то, что она «видела» раньше.

Кратко напомним, Chain-of-Thought (CoT) или «цепочка рассуждений» — это техника, когда модель не сразу выдаёт ответ, а сначала генерирует промежуточные шаги решения. Reasoning-модели вроде OpenAI o3 и DeepSeek R1 просто делают это более интенсивно, тратя больше времени и вычислительных ресурсов на «обдумывание».

Скепсис учёных из Аризоны разделяют многие титаны индустрии. Например, Ян Лекун утверждает, что современные нейросети — это «Система 1» (быстрое интуитивное мышление). CoT — это лишь «Система 1.1», более медленная, но не качественно иная. Для настоящих рассуждений («Система 2») необходима модель мира, которой у нейросетей пока нет.

Несмотря на фундаментальную критику, reasoning-модели показывают революционные улучшения в бенчмарках.


Математика: рост производительности в 3-6 раз. На сложнейшем экзамене AIME результат GPT-4o — 12%, а у OpenAI o1 — 74% с первой попытки.

Спортивное программирование: на платформе Codeforces GPT-4o находится на уровне 23-го перцентиля, а DeepSeek R1 и OpenAI o1 взлетают до 96-го. Это скачок от новичка до уровня эксперта.

Научные рассуждения: в тесте GPQA модель OpenAI o1 превзошла экспертов-людей.

При этом в простых задачах, вроде классификации текста или ответов на общие знания, прирост минимален или отсутствует. А цена и скорость оставляют желать лучшего: o1 в 6 раз дороже и в 30 раз медленнее GPT-4o.

💬 Вывод: не «рассуждающий», а «декомпозирующий» ИИ

С одной стороны, мы имеем убедительные доказательства того, что ИИ не мыслит в человеческом смысле, а искусно подбирает паттерны. С другой — ошеломительные результаты в решении сложных задач.

Противоречия здесь нет. Не стоит ждать от этих моделей создания новых знаний о мире. Их суперсила в том, что они великолепно справляются с декомпозицией — разбивают одну большую и сложную задачу на последовательность маленьких и простых шагов, а затем решают их один за другим. Возможно, термин «рассуждающие» вводит нас в заблуждение. Правильнее было бы называть их «декомпозирующими» сетями.

💬 Тест Тьюринга. События в сфере ИИ. Подписаться
  • ❤ 2
  • 👍 2
  • 🔥 2
More from @testuring
  1. Sep 28, 2026💪 Насколько ИИ уже приблизился к способности улучшать самого себя? Группа из 33 исследова…
  2. Sep 25, 2026🧬 Claude открыл неизвестную генетическую систему Anthropic запустила собственную группу п…
  3. Sep 24, 2026💊 Claude выходит в лабораторную науку Novo Nordisk и Anthropic заключили соглашение об ис…
  4. Sep 23, 2026ИИ, который не умеет генерить текст и картинки, но зато умеет выбирать Соавтор статьи об I…
  5. Sep 22, 2026🧪 Новый инструмент проверки научных гипотез AlphaXiv выпустила OpenResearch — открытую ра…
  6. Sep 21, 2026👿 Новости из Японии: снова оркестрация вместо одной гигантской ИИ-модели 11 сентября япон…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →