TGViewer
НейроХолст НейроХолст @canvasneuro · 743 subscribers
Post #231 378
Обещаю писать поменьше про математику. Но арку надо закончить.

В июле я рассказывал, как Fable опровергла гипотезу Якобиана — одним контрпримером, который можно просто подставить и проверить. Первого августа OpenAI выложила десять открытых задач, закрытых внутренней версией их следующей модели, Astra. Каждая стояла минимум десять лет. И анонс следующей большой модели — вот такой: не столбики на бенчмарках, а список теорем.

Оценивать «важность» этих задач я не возьмусь. Тем более что в математике с важностью всегда было странно: решают сейчас, а зачем это нужно, выясняется через сорок лет и совсем не там, где ждали. Но шкала растёт на глазах. Раньше была мелочь, и все говорили, что серьёзного не будет никогда. Сейчас уже точно не мелочь. А когда пойдут задачи тысячелетия, окажется, что мы не очень понимаем, что с этим делать.

Теперь цифра, ради которой стоило всё это читать: около двух тысяч долларов. Столько стоили токены на поиск всех десяти решений по прайсу их API. Ноам Браун из OpenAI отдельно уточнил, что на каждую задачу они особо не тратились.

И вот отсюда — то, с чем я, кажется, спорю почти со всеми.

В самом анонсе честно написано: рукописи готовили люди, той же моделью, и формулировки сверяли люди. Все за это радостно ухватились — мол, видите, рука направляющая всё ещё нужна, модель без учёного никуда.

Я в это не верю. Не потому, что модель гениальна, а потому что направлять особо нечего. Есть красивое представление, будто у профессора за сорок лет накапливается сакральное чутьё — куда копать, что перспективно, а что тупик. Мне кажется, никакого сакрального знания там нет. Есть контекст: держать в голове тысячу связанных работ, помнить, кто что пробовал и обо что споткнулся, и видеть, где осталась дыра. Это ровно то, что у модели уже больше, чем у человека, и растёт быстрее, чем идёт человеческая карьера.

Так что «пара тысяч долларов — и она сама выдвинет гипотезу, сама её проверит» — это, по-моему, вопрос сроков, а не принципа.

Возможно, я не прав, и есть что-то, что передаётся только из рук в руки и в контекст не влезает. Но пока каждый раз, когда говорили «вот этого ИИ точно не сможет», срок оказывался короче обещанного. Два года назад спорили, напишет ли ЛЛМ межнар по математике хоть как-то. Сейчас новость «большинство моделей пишут на 42 из 42» проходит буднично, и это уже даже не круто. Прошлый пост про Якобиана — из той же серии, и прошло с него десять дней.

А главное вот что. Бенчмарк — это всегда задача, у которой есть известный ответ, поэтому его и можно накрутить (чем регулярно и занимаются, я про это писал). Здесь впервые померились тем, ответа на что не было ни у кого. За две тысячи долларов. И то по прайсу API. Когда-нибудь во дворе можно будет поставить пару стоек и по цене электричества со всей математикой разобраться.
  • 👍 9
More from @canvasneuro
  1. Sep 23, 2026Прикольно, что прогресс моделей, которые пишут текст, меня уже не удивляет. Астра и Фейбл…
  2. Sep 20, 2026А вообще, Я через 15 минут в Точке как часто по вечерам воскресенья)
  3. Sep 20, 2026Post #242
  4. Sep 20, 2026Сегодня хочу обсудить скорее шутливую штуку. Но на всякий случай дам и пару полезностей, ч…
  5. Sep 18, 2026Я сейчас много занимаюсь созданием более автономных агентов — старый ноутбук превратил в л…
  6. Sep 10, 2026История. Личный опыт Итак, своего агента я отправил на борду Дениса той же фразой, слово в…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →