Мой канал. Пишу про себя, математику, аналитику, ML/ИИ, IT, карьеру, бизнес, стартапы и образование.
Для связи - @sh_andrei_a
Post #92
1.08K
Про математику (олимпиадную и не только)
Про математику я пишу редко и вряд ли для этого в будущем будет много поводов, но недавно подвернулся удобный случай совместить приятное с полезным. Итак, начинаем.
Часть 1, полезная
В последнее время было достаточно много интересных сдвигов в применении ИИ в математике, вот онислева направо сверху вниз:
▪️29 января
Команда Google DeepMind прогнала исследовательского агента Aletheia на базе Gemini Deep Think по 700 задачам, отмеченным как открытые в базе задач Эрдеша: для 5 задач агент придумал предположительно новые решения, а еще для 8 обнаружил уже существовавшие решения, разбросанные по старым малоцитируемым статьям и журналам (может показаться, что это такое себе достижение, но в математике периодически случается, что "новый" результат на самом деле уже был доказан 30 лет назад в статье с неочевидным названием, которую почти никто не цитирует)
▪️20 мая
Неназванная general-purpose модель (т.е. никак не заточенная конкретно под математику) от OpenAI опровергла почти 80-летнюю гипотезу Эрдеша (пост на русском), одну из ключевых в дискретной геометрии. Также показали, что результат не случайный: после серии прогонов модели с разным вычислительным бюджетом получили, что при увеличении количества использованных мощностей (грубо говоря длины цепочек рассуждений) модель все чаще и чаще приходила к доказательству, вплоть до половины всех прогонов.
▪️15-16 июля
Claude Opus 5 набрал 42 балла из 42 на IMO 2026 (пост на русском). Этот факт интересен не сам по себе, а в сравнении с IMO 2025:
- в прошлом году без каких-либо ухищрений публично доступные модели набирали в лучшем случае 13 баллов из 42 (и 35 баллов набрали еще не доступные на тот момент публично модели от Google и OpenAI с первыми задатками reasoning)
- содержательный результат в 35 баллов из 42 получился за счет архитектуры solver-verifier, в которой одна LLM в роли solver (генератора) генерировала решение, в роли verifier (критика) сканировала его на ошибки и репортила обнаруженные solver'у, и так по кругу, пока решение не проходило проверку модели-verifier 5 раз подряд. Теперь же Opus 5 решил все задачи без всяких мультиагентных обвязок, и это уже воспринимается скорее как данность, чем как прорыв.
Это касается не только задач по математике: неплохой оценкой развития моделей/агентов можно считать то, насколько хорошо они справляются с задачами, для решения которых раньше требовался harness (грубо говоря система промптов/скиллов/etc.). Это не только мое мнение, создатель Claude Code что-то подобное говорил в своем недавнем интервью (ниже в моем сокращенном переводе):
Claude Fable 5 нашел контрпример к сформулированной еще в 1939 году гипотезе Якобиана в размерности 3, тем самым опровергнув ее для всех размерностей больше 2 (первоисточник, пост на русском). Живем в интересное время, когда контрпримеры к гипотезам почти 90-летней давности выкладывают в Twitter.
▪️22 июля
GPT-5.6 Pro нашел контрпример к открытой с 1999 года стоимостной гипотезе Диница - Гарга - Гёманса из теории графов и комбинаторной оптимизации. Самое крутое в этом кейсе - то, что проделавший это математик поделился в Twitter диалогом с ChatGPT и там буквально череда сообщений типа "соверши прорыв и найди контрпример" -> "продолжай исследование и найди полноценный контрпример" -> "достаточно промежуточных результатов, давай закончим полноценным контрпримером".
▪️1 августа
Внутренняя модель Astra (было ожидаемо, что после Luna, Terra и Sol будет Astra) от OpenAI закрыла или существенно продвинула 10 давно открытых задач в математике и теоретической информатике, потратив ~$2000 по API-ценам Sol (первоисточник, пост на русском 1, пост на русском 2). Все решения формализованы и проверены в Lean - языке программирования для машинной проверки доказательств теорем (т.е. корректность доказательств проверяется автоматически, а ручная проверка нужна уже для понимания общей идеи и значения результата).
Что вообще хочется сказать про все это
На эту часть рассуждений меня отчасти натолкнул вот этот пост, но я бы сформулировал мысль немного иначе: в первую очередь тут напрашивается аналогия с появлением калькуляторов или IDE - первых воспринимали как конец математики, а вторых как читерский инструмент, которым "трушные" программисты ни в коем случае пользоваться не должны.
Целые пласты математической работы, посвященные вычислениям (например, решению алгебраических уравнений или диффуров), перестали быть самостоятельной ценностью после появления компьютеров и доступных вычислительных мощностей. И ничего, не исчезла математика и не обеднела - скорее наоборот появились возможности быстрее проверять гипотезы и заниматься вопросами, до которых раньше не доходили (или не дотягивались из-за отсутствия вычислительных мощностей) руки.
Продолжая аналогию, ИИ может заметно удешевить еще один кусок математической работы - получение доказательства или контрпримера к уже сформулированному утверждению, но для математики в целом мало что меняется: редко бывают содержательные вопросы, в которых надо просто доказать или опровергнуть готовое утверждение, заметно чаще сначала нужно понять, как связаны X и Y, можно ли дать описание факта Z в терминах T и т.д. Получается, что основная сложность постепенно смещается от самого доказательства к формулировке вопроса и пониманию его дальнейшей полезности (или в простонародье "Правильно поставленный вопрос - половина ответа").
Скорее всего в ближайшее время в интернете будет появляться все больше ИИ-доказательств, но большинство из них, вероятно, окажутся никому не нужными: в математических журналах и сейчас хватает технически верных, но бесполезных результатов, просто теперь такие статьи сможет в промышленных масштабах штамповать ИИ. Поэтому главным ограничением все чаще будет не способность доказать утверждение, а способность понять, какое утверждение вообще заслуживает доказательства и человеческого внимания.
Часть 2, приятная
В онлайн-школе "Дабромат" моего товарища Давида Бродского проходит Летний Геометрический Лекторий - серия спецкурсов и открытых лекций, нацеленных на построение моста между олимпиадной геометрией и современными научными методами. Я буду с 10 по 24 августа вести небольшой спецкурс под названием "Соосные окружности и конфигурации типа Понселе" по мотивам моей одноименной статьи в журнале "Математическое просвещение".
В лектории могут участвовать все: олимпиадники, учителя и просто любители красивой геометрии, желающие углубить свои знания. Понимаю, что релевантно это далеко не всем из вас, но тем, кому актуально, присоединяйтесь.
#личное #образование #математика #ИИ
Про математику я пишу редко и вряд ли для этого в будущем будет много поводов, но недавно подвернулся удобный случай совместить приятное с полезным. Итак, начинаем.
Часть 1, полезная
В последнее время было достаточно много интересных сдвигов в применении ИИ в математике, вот они
▪️29 января
Команда Google DeepMind прогнала исследовательского агента Aletheia на базе Gemini Deep Think по 700 задачам, отмеченным как открытые в базе задач Эрдеша: для 5 задач агент придумал предположительно новые решения, а еще для 8 обнаружил уже существовавшие решения, разбросанные по старым малоцитируемым статьям и журналам (может показаться, что это такое себе достижение, но в математике периодически случается, что "новый" результат на самом деле уже был доказан 30 лет назад в статье с неочевидным названием, которую почти никто не цитирует)
▪️20 мая
Неназванная general-purpose модель (т.е. никак не заточенная конкретно под математику) от OpenAI опровергла почти 80-летнюю гипотезу Эрдеша (пост на русском), одну из ключевых в дискретной геометрии. Также показали, что результат не случайный: после серии прогонов модели с разным вычислительным бюджетом получили, что при увеличении количества использованных мощностей (грубо говоря длины цепочек рассуждений) модель все чаще и чаще приходила к доказательству, вплоть до половины всех прогонов.
▪️15-16 июля
Claude Opus 5 набрал 42 балла из 42 на IMO 2026 (пост на русском). Этот факт интересен не сам по себе, а в сравнении с IMO 2025:
- в прошлом году без каких-либо ухищрений публично доступные модели набирали в лучшем случае 13 баллов из 42 (и 35 баллов набрали еще не доступные на тот момент публично модели от Google и OpenAI с первыми задатками reasoning)
- содержательный результат в 35 баллов из 42 получился за счет архитектуры solver-verifier, в которой одна LLM в роли solver (генератора) генерировала решение, в роли verifier (критика) сканировала его на ошибки и репортила обнаруженные solver'у, и так по кругу, пока решение не проходило проверку модели-verifier 5 раз подряд. Теперь же Opus 5 решил все задачи без всяких мультиагентных обвязок, и это уже воспринимается скорее как данность, чем как прорыв.
Это касается не только задач по математике: неплохой оценкой развития моделей/агентов можно считать то, насколько хорошо они справляются с задачами, для решения которых раньше требовался harness (грубо говоря система промптов/скиллов/etc.). Это не только мое мнение, создатель Claude Code что-то подобное говорил в своем недавнем интервью (ниже в моем сокращенном переводе):
Раз в полгода удаляйте CLAUDE.md, скиллы и хуки и проверяйте, как модель работает без них. Новым моделям многие инструкции, необходимые старым, могут быть уже не нужны.
Все пытаются найти какой-то один хитрый трюк для работы с моделями, но его не существует. Вместо этого нужно действовать эмпирически: дать модели задачу, которая кажется для нее слишком сложной, предоставить инструменты для проверки собственной работы, посмотреть, где именно она буксует, и точечно исправить это место улучшенным промптом, скиллом или MCP, если ей не хватает контекста.▪️19-20 июля
Claude Fable 5 нашел контрпример к сформулированной еще в 1939 году гипотезе Якобиана в размерности 3, тем самым опровергнув ее для всех размерностей больше 2 (первоисточник, пост на русском). Живем в интересное время, когда контрпримеры к гипотезам почти 90-летней давности выкладывают в Twitter.
▪️22 июля
GPT-5.6 Pro нашел контрпример к открытой с 1999 года стоимостной гипотезе Диница - Гарга - Гёманса из теории графов и комбинаторной оптимизации. Самое крутое в этом кейсе - то, что проделавший это математик поделился в Twitter диалогом с ChatGPT и там буквально череда сообщений типа "соверши прорыв и найди контрпример" -> "продолжай исследование и найди полноценный контрпример" -> "достаточно промежуточных результатов, давай закончим полноценным контрпримером".
▪️1 августа
Внутренняя модель Astra (было ожидаемо, что после Luna, Terra и Sol будет Astra) от OpenAI закрыла или существенно продвинула 10 давно открытых задач в математике и теоретической информатике, потратив ~$2000 по API-ценам Sol (первоисточник, пост на русском 1, пост на русском 2). Все решения формализованы и проверены в Lean - языке программирования для машинной проверки доказательств теорем (т.е. корректность доказательств проверяется автоматически, а ручная проверка нужна уже для понимания общей идеи и значения результата).
Что вообще хочется сказать про все это
На эту часть рассуждений меня отчасти натолкнул вот этот пост, но я бы сформулировал мысль немного иначе: в первую очередь тут напрашивается аналогия с появлением калькуляторов или IDE - первых воспринимали как конец математики, а вторых как читерский инструмент, которым "трушные" программисты ни в коем случае пользоваться не должны.
Целые пласты математической работы, посвященные вычислениям (например, решению алгебраических уравнений или диффуров), перестали быть самостоятельной ценностью после появления компьютеров и доступных вычислительных мощностей. И ничего, не исчезла математика и не обеднела - скорее наоборот появились возможности быстрее проверять гипотезы и заниматься вопросами, до которых раньше не доходили (или не дотягивались из-за отсутствия вычислительных мощностей) руки.
Продолжая аналогию, ИИ может заметно удешевить еще один кусок математической работы - получение доказательства или контрпримера к уже сформулированному утверждению, но для математики в целом мало что меняется: редко бывают содержательные вопросы, в которых надо просто доказать или опровергнуть готовое утверждение, заметно чаще сначала нужно понять, как связаны X и Y, можно ли дать описание факта Z в терминах T и т.д. Получается, что основная сложность постепенно смещается от самого доказательства к формулировке вопроса и пониманию его дальнейшей полезности (или в простонародье "Правильно поставленный вопрос - половина ответа").
Скорее всего в ближайшее время в интернете будет появляться все больше ИИ-доказательств, но большинство из них, вероятно, окажутся никому не нужными: в математических журналах и сейчас хватает технически верных, но бесполезных результатов, просто теперь такие статьи сможет в промышленных масштабах штамповать ИИ. Поэтому главным ограничением все чаще будет не способность доказать утверждение, а способность понять, какое утверждение вообще заслуживает доказательства и человеческого внимания.
Часть 2, приятная
В онлайн-школе "Дабромат" моего товарища Давида Бродского проходит Летний Геометрический Лекторий - серия спецкурсов и открытых лекций, нацеленных на построение моста между олимпиадной геометрией и современными научными методами. Я буду с 10 по 24 августа вести небольшой спецкурс под названием "Соосные окружности и конфигурации типа Понселе" по мотивам моей одноименной статьи в журнале "Математическое просвещение".
В лектории могут участвовать все: олимпиадники, учителя и просто любители красивой геометрии, желающие углубить свои знания. Понимаю, что релевантно это далеко не всем из вас, но тем, кому актуально, присоединяйтесь.
#личное #образование #математика #ИИ
- ❤ 14
- 🔥 10
- 👍 6
- 💘 3
- 😢 1
- 💯 1







