TGViewer
Тест Тьюринга Тест Тьюринга @testuring · 2.13K subscribers
Post #2164 599
📐 Математический ИИ 2026: от школьных задач до научных прорывов

Еще недавно мы воспринимали нейросети как «цифровых гуманитариев», способных складно писать тексты. Однако к началу 2026 года математика стала новой ареной демонстрации мощности ИИ. И это полезно помнить каждому родителю.

Представьте ситуацию: ребенок приносит домой в качестве домашнего задания задачу по олимпиадной геометрии. Современная модель не просто выдаст ответ, а выступит в роли репетитора: проанализирует фото чертежа, объяснит теорему, которую нужно применить, и проведет через каждый логический шаг, проверяя понимание на каждом этапе.

Но "математический" ИИ уже вышел за пределы учебных классов. Вот лишь несколько примеров того, как нейросети решают задачи, которые десятилетиями не поддавались людям:

1️⃣ Матричное умножение: модель AlphaEvolve еще 3 года назад обнаружила новый алгоритм умножения матриц. Рекорд, установленный человеком 56 лет назад (49 операций), был побит — ИИ нашел способ сделать это за 48 операций. Это фундаментально ускоряет работу всех компьютеров на планете.
2️⃣ Гипотезы Эрдёша: ИИ смог предложить десятки решений для задач великого математика Эрдёша, 13 из которых уже признаны математическим сообществом как новые решения.
3️⃣ Автономные публикации: В 2025 году ИИ-агент Aletheia впервые самостоятельно написал и подготовил к публикации статью по арифметической геометрии, применив методы, до которых исследователи-люди раньше не додумывались.

Битва Титанов: кто лучший в математике?

Безусловным лидером в чистой логике сегодня является GPT-5.2 в режиме thinking. Эта модель стала первой в истории, достигшей невероятных 100% в тесте AIME и 98.2% в наборе MATH 500. Ее отличает способность к сверхдлинным цепочкам рассуждений.

Вплотную к ней идет Gemini 3.1 Pro от Google. Она показывает результат 97.4% на MATH 500, но при этом считается лучшей в мире в мультимодальных задачах — там, где нужно анализировать сложные графики, диаграммы и трехмерные модели.

Замыкают группу лидеров Claude Opus 4.6 от Anthropic, известная своей осторожностью и отсутствием логических ошибок, а также открытая модель Qwen 3.5-397B.

Настоящим открытием стали китайские модели. GLM-5 (Reasoning) и Kimi K2.5 (Thinking) фактически стерли грань между проприетарными и открытыми разработками, показав в олимпиадных тестах результаты выше 96%.

За гениальность приходится платить

Например, в прошлом году использование Gemini 2.5 Pro для решения задач Международной математической олимпиады обходилось примерно в $400 за генерацию всего 24 ответов. Это связано с тем, что для нахождения одного верного доказательства модели приходится проверять тысячи ложных путей.

Методология «Системы 2»: как они это делают?

Секрет успеха моделей 2026 года — в архитектуре рассуждений. Раньше ИИ работал по принципу «быстрого мышления» Системы 1, выдавая первый пришедший «в голову» ответ. Современные системы используют Систему 2 — медленное, осознанное мышление.

Ключевая инновация — Process Reward Models. Модели обучают получать награду не за правильный ответ в конце, а за каждый верный шаг в цепочке рассуждений. Если модель ошибается на втором шаге из десяти, система верификации заставляет ее вернуться и искать другой путь. Это дополняется алгоритмами поиска по дереву решений, как в шахматных программах, что позволяет ИИ буквально «обдумывать» задачу.

Как измеряют математический «ум»?

Чтобы сравнить модели, исследователи используют специфические бенчмарки:

➡️ AIME: задачи уровня национальных олимпиад, требующие нестандартного мышления.
➡️ MATH 500: сложнейшие задачи из разных областей математики — от алгебры до теории чисел.
➡️ FrontierMath: «золотой стандарт» 2026 года. Это задачи, сформулированные профессиональными математиками специально для того, чтобы их нельзя было найти в интернете. Здесь важна не память, а способность выводить новые решения.

💬 Тест Тьюринга. События в сфере ИИ. Подписаться
  • 🔥 3
  • ❤ 2
More from @testuring
  1. Sep 24, 2026💊 Claude выходит в лабораторную науку Novo Nordisk и Anthropic заключили соглашение об ис…
  2. Sep 23, 2026ИИ, который не умеет генерить текст и картинки, но зато умеет выбирать Соавтор статьи об I…
  3. Sep 22, 2026🧪 Новый инструмент проверки научных гипотез AlphaXiv выпустила OpenResearch — открытую ра…
  4. Sep 21, 2026👿 Новости из Японии: снова оркестрация вместо одной гигантской ИИ-модели 11 сентября япон…
  5. Sep 18, 2026⚠️ ИИ уже нарушает правила, которые люди только начинают писать На этой неделе произошло с…
  6. Sep 17, 2026⚡️ Новая мировая линейка неравенства между государствами будет измеряться токенами China T…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →