Со вчерашнего вечера все только и разговаривают об анонсе Астры. Закинул тред на реддите в ChatGPT, так он начал расписывать мне какая она крутая матом.
Бенчмарки кричат, что AGI уже рядом, расскажу, где действительно круто, а где бенчмаркетинг.
💪 Раскатывают всем, но сначала корпорациям
Первыми доступ получили компании из программы Daybreak. Дальше по очереди Pro, Plus, Business, Enterprise, API и AWS.
Приятная часть: Тибо Соттьё, глава Codex, пообещал кумулятивный сброс лимитов за каждый день, пока у вас нет доступа к Астре на платном тарифе. Альтман отдельно извинился за кривой запуск — блог-пост успел выйти, пропасть и вернуться. Ожидаю, что к моменту теста у меня накопится лимитов штук пять.
🚀 Бенчмарки рвут, но со звёздочкой
99,9% на ARC-AGI-3 — цифра из анонса. В сноске: прогон шёл на responses API harness от OpenAI, который «меняет две настройки, чтобы лучше соответствовать реальной работе».
ARC Prize выложили обе цифры честно: 62,7% на стандартной обвязке за 26 098 $ и 99,9% на провайдерской за 18 817 $. А в таблице OpenAI рядом с 99,9% стоит Opus 5 с его 30,2%. По сути там только сохранение рассуждений между вызовами + компактизация.
😀 Обе цифры настоящие. Только 62,7% — это про модель, а 99,9% — про модель вместе с обвязкой.
⚙️ Планка задрана, но не везде
Computer use Astra действительно забирает: OSWorld 2.0 — 72,6% против 65,7% у Sol, и на 47% меньше времени на задачу.
Кибербез — 100% на ExploitBench получены без продакшен-защит. Тут я слабо разбираюсь в вопросе, поэтому просто поверю на слово, что стало круто.
А про это в анонсе не написали вообще:
— Humanity's Last Exam: 57,2% у Astra против 65,0% у Fable 5.1
— Artificial Analysis Intelligence Index: 61,2 у Astra, 60,9 у Sol, 63,1 у Opus 5, 65,7 у Fable 5.1
Прирост над собственным предшественником — 0,3 пункта.
💰 Сколько это стоит
За миллион токенов, вход / выход:
- GPT-6 Astra — 10 $ / 50 $
- Astra на контексте от 272 000 токенов — 20 $ / 75 $, причём за весь запрос целиком, а не за превышение
- Astra в Fast mode — 20 $ / 100 $
- GPT-5.6 Sol — 4 $ / 20 $
- Claude Fable 5.1 — 10 $ / 50 $
- Claude Opus 5 — 5 $ / 25 $
- Gemini 3.1 Pro — 2 $ / 12 $
Astra ровно вдвое дороже Opus 5 и в 2,5 раза дороже собственного Sol. С Fable 5.1 паритет по прайсу, но чтение из кэша у Astra стоит 1 $ против 0,25 $ — на агентских циклах, которые перечитывают контекст каждый шаг, разница набегает быстро.
Кто уже получил доступ и гонял Astra на своих задачах — на чём она реально обошла Opus 5 или Fable 5.1?
В комментарии кину видео-сравнение генерации в Blender с твиттера.
----
Поляков считает — AI, код и кейсы


