Всю неделю собирался написать про GPT-6 Astra — и опоздал: она уже не самая сильная модель OpenAI. Но по порядку.
В среду вышла Astra. Из всего, что она умеет, меня больше всего занимает ARC-AGI-3 — бенчмарк Франсуа Шолле, где модель кидают в незнакомую игру, и она должна сама разобраться в правилах и дойти до цели. Прошлый рекорд был около 30% (Сlaude Opus 5). Astra в стандартных для всех условиях выдала 62,7%, а со своей встроенной памятью — 99,9%. Шолле говорит, что ждал таких цифр «примерно через год» — случилось вдвое быстрее, чем он думал. (Авторы бенчмарка тут же уточнили, что насыщение ARC-AGI — ещё не AGI. Но назвали бенчмарк они сами.)
При этом полезно помнить: публичные модели — не самые сильные из существующих. Есть класс моделей, закрытых для публики, — у Anthropic, например, рядом с обычным Fable живёт Mythos: та же модель, но без части ограничений, и доступ к ней дают только одобренным организациям.
А есть ещё модели, которые пока просто тренируются. И вот вчера OpenAI показала, на что способна одна из таких: внутренняя модель следующего поколения — «заметно сильнее Astra», тренируется с 28 августа и до сих пор не дотренировалась — решила проблему Навье–Стокса, одну из семи проблем тысячелетия. Десять тысяч параллельных агентов, 88 часов работы, 165 страниц доказательства плюс формализация в Lean. (Строго говоря, решён форсированный вариант из формулировки Феффермана, премию Clay они не просят, и проверка математиками только началась — но даже так.)
Вокруг доказательства уже и скандал: математик, который год шёл к тому же результату и гонял свои черновики через Codex, теперь спрашивает OpenAI, не из его ли чатов модель узнала направление. Я лично в обучение модели на его чате совсем не верю. Вряд ли чаты скармливают моделям без обработки — как я писал выше, я пока продолжаю считать, что из них достают сценарии использования и оценивают, довела ли модель пользователя до успеха. А насчёт «украли из выборки» есть свежее исследование MIT: даже если полностью убрать конкретного художника из обучающих данных, модель всё равно генерит в его стиле — след одного автора в таких масштабах просто не прослеживается (авторы называют это attribution decay).
Итого расклад на сегодня: публичная модель проходит бенчмарк с «AGI» в названии, закрытая — сильнее неё, а недотренированная — решает проблему тысячелетия. Я не успеваю писать посты со скоростью, с которой они устаревают.
P.S. Посмотреть, что люди делают с Astra, можно, например, вот в этих телеграм-постах: Денис восстановил 3D-карту дачи детства по десятку старых фото и видео (и дальше по каналу ещё серия экспериментов — вплоть до порванных фотографий, которые Astra за полчаса нашла в исходных альбомах), Градиент обреченный собрал квест по мотивам Full Throttle, а у Ai molodca подписчики делятся кейсами в комментариях — от расшифровки телетекста с убитой VHS-кассеты до агента, который сам по-китайски договорился с техподдержкой China Unicom о заморозке симки.
Post #237
377
- 👍 10
- ❤ 2
- 🤔 1
- 🤯 1