TGViewer
демшиза ии киберпанк демшиза ии киберпанк @dempunk · 69 subscribers
Post #23331 1

Forwarded from Сиолошная

Но этот подход сработал, пока статья была одна и решений была парочка; но что если взять мощные внутренние модели фронтир компаний и пройтись по широкому набору открытых проблем? Так сделали OpenAI: они взяли ту же модель, что решила задачу тысячелетия в начале сентября и пропустили через неё примерно 4000 задач. Количество мощностей почти на каждую задачу было относительно маленьким: вместо роя из тысяч агентов всего лишь аналог ~3 часов работы GPT Pro (это которая запускает несколько суб-агентов в паралелль, и в целом доступна в подписке за $100/$200).

Получилось решить 372, и по этим результатам LLM написали 719 статей (сами решения + сопутствующие аргументы, следствия или альтернативные доказательства).

Перед OpenAI встал выбор: а чо делать та)

В прошлый раз, когда они выложили один (1) результат по Навье-Стоксу — на них ополчилась часть математического сообщества. Не все были довольны, особенно те, кто работал в том же направлении. А тут целых 372 результата — это же сотни рабочих групп, от студентов до докторов наук, по всему миру. Они вот сидели работали год или даже больше над чем-то, возможно были очень близки, а тут... выйдет вайб-слоп статья от внутренней модели OpenAI, которая даёт результат? Как на это отреагируют?

Кажется, что повторить подход Anthropic будет сложно чисто с организационной точки зрения: искать сотни людей в академии, подписывать с ними соглашения, терпеть людей вроде Buckmeister, которые скажут, что украли их результаты, и платить за ревью.

В итоге OpenAI сделали простое заявление, выложили все результаты на GitHub. 63% от 372 основных результатов помимо статьи имеют формализованное на Lean доказательство (это язык программирования для математиков, на котором можно записать доказательство, а компьютер проверит, что в нём нет несостыковок и ошибок). Это не даёт 100% гарантии что они все верны, но в целом является солидным подкреплением. Я удивлюсь, если в формализованных результатах, скажем, больше 10-12% будет ошибочным — и ещё меньшая часть будет неисправима в краткие сроки.

OpenAI уже отозвали 3 статьи, исправили ещё 14, правда я не нашел статистики сколько исправлений как раз в формализованных результатах.

Может ли научное сообщество игнорировать этот сказочный слоп дроп? Нет: там есть очень сильные результаты, и как минимум про 10 разных статей я читал от, кажется, авторитетных математиков и учёных других областей, что сам по себе такой результат, будь он опубликован человеком, сделал бы ему имя, попало бы в ведущий журнал или вовсе привело к получению Филдсовской премии. Сложно закрыть глаза, сказать «ничего этого нет» и продолжить работу как будто ничего не случилось.

Но и вычитывать ошибки за LLM или брать решение OpenAI «на веру» и не разбираться в нём (а разбирать LLM-сгенерированные статьи без вычитки и полировки очень сложно, с этим согласны кажется все) научное сообщество не готово, да и не должно.

Так что сейчас идут активные обсуждения будущего математики и смежных наук. Как должно выглядеть будущее, где компания в один день может подрезать работы тысяч учёных? Как тем работать, зная, что перед релизом следующей модели существует угроза его работе? В чем искать смысл?
More from @dempunk
  1. Oct 10, 2026На заводі "Алабуга" що у Татарстані, будують десятки складських будівель та економічні зон…
  2. Oct 10, 2026Наслідки знищеного танкера AFRAMAX RIO, що був уражений морським дроном 6-го жовтня. Унасл…
  3. Oct 10, 2026❗️20 загиблих через ранкову ворожу атаку, - кількість загиблих зросла. Ще 32 людини дістал…
  4. Oct 10, 2026❗️Пошуково-рятувальна операція триває. З самого ранку на місці ворожої атаки працюють всі…
  5. Oct 10, 2026🗣На цю хвилину ранкова ворожа атака забрала життя 18 людей. Ще 17 людей отримали пораненн…
  6. Oct 10, 2026В понедельник 5-го октября на архив выложили препринт «Truly Subquadratic 3SUM and Truly S…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →