Обещаю писать поменьше про математику. Но арку надо закончить.
В июле я рассказывал, как Fable опровергла гипотезу Якобиана — одним контрпримером, который можно просто подставить и проверить. Первого августа OpenAI выложила десять открытых задач, закрытых внутренней версией их следующей модели, Astra. Каждая стояла минимум десять лет. И анонс следующей большой модели — вот такой: не столбики на бенчмарках, а список теорем.
Оценивать «важность» этих задач я не возьмусь. Тем более что в математике с важностью всегда было странно: решают сейчас, а зачем это нужно, выясняется через сорок лет и совсем не там, где ждали. Но шкала растёт на глазах. Раньше была мелочь, и все говорили, что серьёзного не будет никогда. Сейчас уже точно не мелочь. А когда пойдут задачи тысячелетия, окажется, что мы не очень понимаем, что с этим делать.
Теперь цифра, ради которой стоило всё это читать: около двух тысяч долларов. Столько стоили токены на поиск всех десяти решений по прайсу их API. Ноам Браун из OpenAI отдельно уточнил, что на каждую задачу они особо не тратились.
И вот отсюда — то, с чем я, кажется, спорю почти со всеми.
В самом анонсе честно написано: рукописи готовили люди, той же моделью, и формулировки сверяли люди. Все за это радостно ухватились — мол, видите, рука направляющая всё ещё нужна, модель без учёного никуда.
Я в это не верю. Не потому, что модель гениальна, а потому что направлять особо нечего. Есть красивое представление, будто у профессора за сорок лет накапливается сакральное чутьё — куда копать, что перспективно, а что тупик. Мне кажется, никакого сакрального знания там нет. Есть контекст: держать в голове тысячу связанных работ, помнить, кто что пробовал и обо что споткнулся, и видеть, где осталась дыра. Это ровно то, что у модели уже больше, чем у человека, и растёт быстрее, чем идёт человеческая карьера.
Так что «пара тысяч долларов — и она сама выдвинет гипотезу, сама её проверит» — это, по-моему, вопрос сроков, а не принципа.
Возможно, я не прав, и есть что-то, что передаётся только из рук в руки и в контекст не влезает. Но пока каждый раз, когда говорили «вот этого ИИ точно не сможет», срок оказывался короче обещанного. Два года назад спорили, напишет ли ЛЛМ межнар по математике хоть как-то. Сейчас новость «большинство моделей пишут на 42 из 42» проходит буднично, и это уже даже не круто. Прошлый пост про Якобиана — из той же серии, и прошло с него десять дней.
А главное вот что. Бенчмарк — это всегда задача, у которой есть известный ответ, поэтому его и можно накрутить (чем регулярно и занимаются, я про это писал). Здесь впервые померились тем, ответа на что не было ни у кого. За две тысячи долларов. И то по прайсу API. Когда-нибудь во дворе можно будет поставить пару стоек и по цене электричества со всей математикой разобраться.
Post #231
378
- 👍 9