TGViewer
AI Product | Igor Akimov AI Product | Igor Akimov @ai_product · 8.27K subscribers
Post #2446 1.62K
OpenAI вывалили на GitHub 722 математические статьи от своей внутренней модели. Одним релизом :)

Да, тоже было интересно разобраться, что там вышло. Математикам тоже приготовиться на выход?

Короче, в сентябре они заявили, что решили одну из задач тысячелетия (за каждую дают $1M) – 88 часов, тысячи агентов параллельно. После этого 25 лауреатов Филдсовской премии (математический «Нобель», там и Теренс Тао) подписали открытое письмо: вы решаете задачи как бенчмарк, а математике нужно понимание. OpenAI сходили посоветоваться с математиками из Принстона и... выложили ещё 722 статьи :)

Модели дали ~4000 открытых задач, на которых люди застряли. Из этого получилось 722 статьи с решениями.
– В среднем 3 часа думанья уровня ChatGPT Pro на результат. Не суперкластер, а примерно то, что вы можете сделать сами за вечер, только модель внутренняя
– 162 доказательства проверены в Lean. Это такой язык программирования для математики: доказательство пишется как код, и компьютер его проверяет как компилятор. Скомпилировалось – значит без ошибок. Остальные 560 никто толком не проверял, в README так и написано: «могут быть ошибки»

Что из этого понятно не только математикам:
– Гипотеза уникальных игр. Она про то, какие задачи оптимизации в принципе нельзя решить хорошо даже приблизительно. Из доказательства следует, что для кучи практических задач (разбить сеть на части, раскидать ресурсы, кластеризовать) нынешние алгоритмы уже лучшие из возможных, и искать лучше бессмысленно. Проверено в Lean
– «Почти гипотеза Римана». Сама гипотеза Римана – главная нерешённая задача математики, про то, насколько равномерно разбросаны простые числа. Её ослабленную версию не могли доказать с XIX века. Модель доказала. Тоже в Lean
– Нельзя написать программу, которая для любого уравнения скажет, есть ли у него решение в дробях. Вопрос висел десятилетиями. Без Lean
– Кусок ещё одной задачи тысячелетия (гипотеза Ходжа). Объяснить на пальцах её не может никто, так что поверим на слово :)

Но!
– Самые громкие результаты получены не той стандартной процедурой на 3 часа, а отдельно, и один текст правили люди
– Lean проверяет, что код соответствует ТЗ. А правильно ли написано само ТЗ, то есть то ли вообще доказали, – всё равно смотреть людям
– Авторов нет, всё подписано «OpenAI». Модель не выпущена, обещают «ответственный релиз»

Прикол, что письмо было ровно про то, что математикам не нужны сотни решённых задач без понимания. В ответ им дали 722 решённые задачи, но с компиляцией и пересказами того, как модель думала :)

Короче, узкое место переехало с «найти решение» на «проверить и понять решение». Ровно как с код-агентами: написать код уже не проблема, проблема – ревью. Только тут ревью одной статьи у живого математика занимает месяцы. Ну и если внутренняя модель за 3 часа такое делает, то следующий релиз OpenAI будет интересным. Математика в общем будет вайб-математикой. Представляю, как профессора и аспиранты закидывают какие-нибудь сложные штуки из своей области, над которой бьются годами, и получают решение за 3 часа. Так как математика супер-формализуема и проверяема, то кажется для ИИ это вообще не будет проблемой в ближайшем будущем.

https://openai.com/index/sharing-ai-progress-in-mathematics/
OpenAI Sharing AI progress in mathematics OpenAI publishes new results on open problems in mathematics from an internal frontier model and shares Lean proof formalizations and research details on GitHub.
  • 🔥 8
  • ❤ 5
  • 👏 3
More from @ai_product
  1. Oct 8, 2026Мне тут дали промокод на скидку 50% на AI-митап для бизнеса в Никосии Panis.News (это один…
  2. Oct 8, 2026Короче для Haiku чуда не случилось, слишком сильная конкуренция Если брать сравнение с ана…
  3. Oct 7, 2026Опа, Anthropic выкатили Haiku 5.5 Не обновляли год, у конкурентов даже уже крутые маленьки…
  4. Oct 6, 2026Блин, мне проапрувили почти сразу, вау!
  5. Oct 6, 2026О, Anthropic расширили программу Claude Startups – теперь до $7K на Claude и до $45K на па…
  6. Oct 6, 2026Mistral зарелизил версию 4 Типа самая мощная за пределами Китая и США. Даже круче корейско…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →