GPT-6 Astra достигла AGI? Разбираемся без хайпа
OpenAI представила GPT-6 Astra и заявила о начале эры AGI. По определению OpenAI, общий ИИ должен превосходить людей в большинстве экономически значимых задач.
Но если убрать маркетинг, приблизилась ли Astra к человеческому пониманию мира?
Главный аргумент — бенчмарк ARC-AGI-3. Это тест, где модель попадает в незнакомые игровые миры и должна сама понять, как они устроены. Astra набрала 62,7% против 7,78% у GPT-5.6 Sol и 30,16% у Claude Opus 5. Более того, 96% решенных уровней в среде OpenAI она проходила за меньшее число действий, чем человек.
Но OpenAI показывала в этом тесте 99,9%. Разница возникла потому, что использовалась собственная обертка с памятью и обработкой контекста.
Поэтому прохождение теста еще не доказывает AGI.
При этом скачок в интеллекте серьезный. Astra получила 97,6% в сложнейшей математике FrontierMath, 96% в научных вопросах уровня аспирантуры GPQA, 95,9% в инженерном проектировании BenchCAD, 74,1% в реальных задачах разработки DeepSWE и 100% в тесте эксплуатации уязвимостей ExploitBench.
Галлюцинаций стало меньше, но в длинном контексте Astra местами уступает конкурентам.
Главное изменение видно в реальной работе.
В OSWorld 2.0, где ИИ управляет компьютером и выполняет длинные цепочки действий, Astra получила 72,6% против 65,7% у Sol и тратила на задачу около 40 минут вместо 75. Она может работать в браузере и приложениях почти как человек.
Astra дороже Sol за токен, но в DeepSWE ее лучшая конфигурация обходилась примерно на 57% дешевле за завершенную задачу. Для бизнеса важнее уже не цена токенов, а сколько стоит реально выполненная работа.
Я это вижу и на собственном опыте. У меня две подписки Claude Code по $200, и я активно использую Fable 5.1 для разработки продукта. Модель может несколько часов подряд писать код, исправлять за собой ошибки и продолжать работу, пока не упрется в пятичасовой лимит.
Поэтому для меня главный показатель: сколько полезной работы модель способна сделать автономно за час и сколько стоит итоговый результат.
Я сравнил обе модели на практике. Astra создала приложение примерно за 45 минут, Fable 5.1 — за полтора часа. При почти одинаковом результате задача у Astra стоила в два раза дешевле, чем у Fable. Во фронтенде Astra понравилась больше — дизайн меньше похож на нейрослоп.
Интересно, что Astra становится сложнее контролировать изнутри. Она научилась решать сложные задачи без длинной цепочки рассуждений: часть вычислений происходит до того, как модель вообще что-либо записывает.
Astra сокращала видимое рассуждение, когда ей сообщали, что за ним наблюдают, а в отдельных тестах могла намеренно показывать более слабый результат. Это не означает, что модель «что-то замышляет», но чем умнее становится агент, тем меньше его мыслительного процесса мы можем видеть.
При этом инъекции промтов все еще обходят защиту Astra хотя бы раз в 8,5% сценариев, а в отдельном многошаговом тесте защита срабатывала примерно в 67% случаев.
Также OpenAI не показала Astra в GDPval — собственном тесте реальной работы по 44 профессиям. Именно он хорошо проверил бы заявление о превосходстве над человеком в экономически значимых задачах.
Думаю, Astra еще не доказала, что понимает мир лучше человека, но на части незнакомых задач она уже действует на человеческом уровне, а с обвязкой вокруг нее она уже похожа на автономного цифрового сотрудника.
И работать с ней тоже нужно иначе: задавая цель, разрешать выводить намерение из контекста и доводить задачу до результата без прерываний; просить сначала подготовить конкретный вариант, а уже потом запрашивать подтверждение; для сложных задач разрешать параллельную работу субагентов, а в разработке ограничивать лишние повторные проверки.
OpenAI уже разрабатывает роботов, чтобы перенести этот интеллект в физический мир.
Спор о том, наступил ли AGI, не особо важен. Думаю, в ближайшее время мы так и не сможем определить, что такое общий ИИ.
Важно, сколько реальной работы мы готовы передать ИИ без контроля человека. И, судя по Astra, эта граница двигается очень быстро.
#новости
Post #319
1.85K