В мире ИИ новый тренд — «рассуждающие» нейросети (reasoning models). OpenAI o3, GPT-5, DeepSeek R1 и V3.1, Gemini 2.5 Deep Think и другие их преподносят как прорыв, способный не просто генерировать текст, а мыслить. Но так ли это на самом деле?
В августе вышла статья учёных из Университета Аризоны «Is Chain-of-Thought Reasoning of LLMs a Mirage? A Data Distribution Lens». В отличие от большинства тестов, исследователи не просто прогоняли готовые модели по бенчмаркам. Они создали специальную среду DataAlchemy и обучили нейросети с нуля на простых задачах, полностью контролируя процесс. Это позволило исключить влияние скрытых знаний из гигантских датасетов и проверить именно способность к логическому выводу.
Главные выводы исследования:
👉 Столкнувшись с задачами, которые хоть немного отличались от обучающих примеров, точность моделей падала со 100% почти до нуля. Вместо логического вывода они просто пытались воспроизвести знакомые шаблоны.
👉 Модели не могли обобщить рассуждения на цепочки другой длины и «ломались» даже от незначительных изменений в формулировке промпта, например, от вставки «шумовых» слов.
👉 Гипотеза учёных подтвердилась — эффективность модели напрямую зависит от того, насколько тестовая задача похожа на то, что она «видела» раньше.
Кратко напомним, Chain-of-Thought (CoT) или «цепочка рассуждений» — это техника, когда модель не сразу выдаёт ответ, а сначала генерирует промежуточные шаги решения. Reasoning-модели вроде OpenAI o3 и DeepSeek R1 просто делают это более интенсивно, тратя больше времени и вычислительных ресурсов на «обдумывание».
Скепсис учёных из Аризоны разделяют многие титаны индустрии. Например, Ян Лекун утверждает, что современные нейросети — это «Система 1» (быстрое интуитивное мышление). CoT — это лишь «Система 1.1», более медленная, но не качественно иная. Для настоящих рассуждений («Система 2») необходима модель мира, которой у нейросетей пока нет.
Несмотря на фундаментальную критику, reasoning-модели показывают революционные улучшения в бенчмарках.
Математика: рост производительности в 3-6 раз. На сложнейшем экзамене AIME результат GPT-4o — 12%, а у OpenAI o1 — 74% с первой попытки.
Спортивное программирование: на платформе Codeforces GPT-4o находится на уровне 23-го перцентиля, а DeepSeek R1 и OpenAI o1 взлетают до 96-го. Это скачок от новичка до уровня эксперта.
Научные рассуждения: в тесте GPQA модель OpenAI o1 превзошла экспертов-людей.
При этом в простых задачах, вроде классификации текста или ответов на общие знания, прирост минимален или отсутствует. А цена и скорость оставляют желать лучшего: o1 в 6 раз дороже и в 30 раз медленнее GPT-4o.
💬 Вывод: не «рассуждающий», а «декомпозирующий» ИИ
С одной стороны, мы имеем убедительные доказательства того, что ИИ не мыслит в человеческом смысле, а искусно подбирает паттерны. С другой — ошеломительные результаты в решении сложных задач.
Противоречия здесь нет. Не стоит ждать от этих моделей создания новых знаний о мире. Их суперсила в том, что они великолепно справляются с декомпозицией — разбивают одну большую и сложную задачу на последовательность маленьких и простых шагов, а затем решают их один за другим. Возможно, термин «рассуждающие» вводит нас в заблуждение. Правильнее было бы называть их «декомпозирующими» сетями.
💬 Тест Тьюринга. События в сфере ИИ. Подписаться
