TGViewer
Andrei Shevtsov Andrei Shevtsov @sh_andrei_channel · 931 subscribers
Post #92 1.08K
Про математику (олимпиадную и не только)

Про математику я пишу редко и вряд ли для этого в будущем будет много поводов, но недавно подвернулся удобный случай совместить приятное с полезным. Итак, начинаем.

Часть 1, полезная

В последнее время было достаточно много интересных сдвигов в применении ИИ в математике, вот они слева направо сверху вниз:
▪️29 января
Команда Google DeepMind прогнала исследовательского агента Aletheia на базе Gemini Deep Think по 700 задачам, отмеченным как открытые в базе задач Эрдеша: для 5 задач агент придумал предположительно новые решения, а еще для 8 обнаружил уже существовавшие решения, разбросанные по старым малоцитируемым статьям и журналам (может показаться, что это такое себе достижение, но в математике периодически случается, что "новый" результат на самом деле уже был доказан 30 лет назад в статье с неочевидным названием, которую почти никто не цитирует)
▪️20 мая
Неназванная general-purpose модель (т.е. никак не заточенная конкретно под математику) от OpenAI опровергла почти 80-летнюю гипотезу Эрдеша (пост на русском), одну из ключевых в дискретной геометрии. Также показали, что результат не случайный: после серии прогонов модели с разным вычислительным бюджетом получили, что при увеличении количества использованных мощностей (грубо говоря длины цепочек рассуждений) модель все чаще и чаще приходила к доказательству, вплоть до половины всех прогонов.
▪️15-16 июля
Claude Opus 5 набрал 42 балла из 42 на IMO 2026 (пост на русском). Этот факт интересен не сам по себе, а в сравнении с IMO 2025:
   - в прошлом году без каких-либо ухищрений публично доступные модели набирали в лучшем случае 13 баллов из 42 (и 35 баллов набрали еще не доступные на тот момент публично модели от Google и OpenAI с первыми задатками reasoning)
   - содержательный результат в 35 баллов из 42 получился за счет архитектуры solver-verifier, в которой одна LLM в роли solver (генератора) генерировала решение, в роли verifier (критика) сканировала его на ошибки и репортила обнаруженные solver'у, и так по кругу, пока решение не проходило проверку модели-verifier 5 раз подряд. Теперь же Opus 5 решил все задачи без всяких мультиагентных обвязок, и это уже воспринимается скорее как данность, чем как прорыв.
Это касается не только задач по математике: неплохой оценкой развития моделей/агентов можно считать то, насколько хорошо они справляются с задачами, для решения которых раньше требовался harness (грубо говоря система промптов/скиллов/etc.). Это не только мое мнение, создатель Claude Code что-то подобное говорил в своем недавнем интервью (ниже в моем сокращенном переводе):
Раз в полгода удаляйте CLAUDE.md, скиллы и хуки и проверяйте, как модель работает без них. Новым моделям многие инструкции, необходимые старым, могут быть уже не нужны.

Все пытаются найти какой-то один хитрый трюк для работы с моделями, но его не существует. Вместо этого нужно действовать эмпирически: дать модели задачу, которая кажется для нее слишком сложной, предоставить инструменты для проверки собственной работы, посмотреть, где именно она буксует, и точечно исправить это место улучшенным промптом, скиллом или MCP, если ей не хватает контекста.
▪️19-20 июля
Claude Fable 5 нашел контрпример к сформулированной еще в 1939 году гипотезе Якобиана в размерности 3, тем самым опровергнув ее для всех размерностей больше 2 (первоисточник, пост на русском). Живем в интересное время, когда контрпримеры к гипотезам почти 90-летней давности выкладывают в Twitter.
▪️22 июля
GPT-5.6 Pro нашел контрпример к открытой с 1999 года стоимостной гипотезе Диница - Гарга - Гёманса из теории графов и комбинаторной оптимизации. Самое крутое в этом кейсе - то, что проделавший это математик поделился в Twitter диалогом с ChatGPT и там буквально череда сообщений типа "соверши прорыв и найди контрпример" -> "продолжай исследование и найди полноценный контрпример" -> "достаточно промежуточных результатов, давай закончим полноценным контрпримером".
▪️1 августа
Внутренняя модель Astra (было ожидаемо, что после Luna, Terra и Sol будет Astra) от OpenAI закрыла или существенно продвинула 10 давно открытых задач в математике и теоретической информатике, потратив ~$2000 по API-ценам Sol (первоисточник, пост на русском 1, пост на русском 2). Все решения формализованы и проверены в Lean - языке программирования для машинной проверки доказательств теорем (т.е. корректность доказательств проверяется автоматически, а ручная проверка нужна уже для понимания общей идеи и значения результата).

Что вообще хочется сказать про все это
На эту часть рассуждений меня отчасти натолкнул вот этот пост, но я бы сформулировал мысль немного иначе: в первую очередь тут напрашивается аналогия с появлением калькуляторов или IDE - первых воспринимали как конец математики, а вторых как читерский инструмент, которым "трушные" программисты ни в коем случае пользоваться не должны.
Целые пласты математической работы, посвященные вычислениям (например, решению алгебраических уравнений или диффуров), перестали быть самостоятельной ценностью после появления компьютеров и доступных вычислительных мощностей. И ничего, не исчезла математика и не обеднела - скорее наоборот появились возможности быстрее проверять гипотезы и заниматься вопросами, до которых раньше не доходили (или не дотягивались из-за отсутствия вычислительных мощностей) руки.
Продолжая аналогию, ИИ может заметно удешевить еще один кусок математической работы - получение доказательства или контрпримера к уже сформулированному утверждению, но для математики в целом мало что меняется: редко бывают содержательные вопросы, в которых надо просто доказать или опровергнуть готовое утверждение, заметно чаще сначала нужно понять, как связаны X и Y, можно ли дать описание факта Z в терминах T и т.д. Получается, что основная сложность постепенно смещается от самого доказательства к формулировке вопроса и пониманию его дальнейшей полезности (или в простонародье "Правильно поставленный вопрос - половина ответа").
Скорее всего в ближайшее время в интернете будет появляться все больше ИИ-доказательств, но большинство из них, вероятно, окажутся никому не нужными: в математических журналах и сейчас хватает технически верных, но бесполезных результатов, просто теперь такие статьи сможет в промышленных масштабах штамповать ИИ. Поэтому главным ограничением все чаще будет не способность доказать утверждение, а способность понять, какое утверждение вообще заслуживает доказательства и человеческого внимания.

Часть 2, приятная

В онлайн-школе "Дабромат" моего товарища Давида Бродского проходит Летний Геометрический Лекторий - серия спецкурсов и открытых лекций, нацеленных на построение моста между олимпиадной геометрией и современными научными методами. Я буду с 10 по 24 августа вести небольшой спецкурс под названием "Соосные окружности и конфигурации типа Понселе" по мотивам моей одноименной статьи в журнале "Математическое просвещение".

В лектории могут участвовать все: олимпиадники, учителя и просто любители красивой геометрии, желающие углубить свои знания. Понимаю, что релевантно это далеко не всем из вас, но тем, кому актуально, присоединяйтесь.

#личное #образование #математика #ИИ
  • ❤ 14
  • 🔥 10
  • 👍 6
  • 💘 3
  • 😢 1
  • 💯 1
More from @sh_andrei_channel
  1. Jul 29, 2026Про ИИ-агентов Вообще следующим постом планировалась завершающая часть серии про HFT, но в…
  2. Jul 27, 2026Про работу: часть 3 В прошлом посте разобрались с тем, как в целом устроена HFT-индустрия,…
  3. Jul 13, 2026Про работу: часть 2 Итак, сегодня расскажу вам чуть подробнее про сферу, в которой сейчас…
  4. Jul 3, 2026Про работу Настало время подробнее написать про то, куда и почему я ушел из Яндекса. Часть…
  5. May 26, 2026Всем привет! Больше полугода не было постов в канале: вижу что отписываться люди, каюсь. З…
  6. Oct 31, 2025Однажды Эрнест Хемингуэй поспорил, что напишет самый короткий рассказ, способный растрогат…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →