TGViewer
Поляков считает: AI, код и кейсы Поляков считает: AI, код и кейсы @countwithsasha · 6.62K subscribers
Post #781 3.04K
OpenAI начали раскатывать GPT-6 Astra. Снова разрыв бенчмарков

Со вчерашнего вечера все только и разговаривают об анонсе Астры. Закинул тред на реддите в ChatGPT, так он начал расписывать мне какая она крутая матом.
Бенчмарки кричат, что AGI уже рядом, расскажу, где действительно круто, а где бенчмаркетинг.

💪 Раскатывают всем, но сначала корпорациям

Первыми доступ получили компании из программы Daybreak. Дальше по очереди Pro, Plus, Business, Enterprise, API и AWS.

Приятная часть: Тибо Соттьё, глава Codex, пообещал кумулятивный сброс лимитов за каждый день, пока у вас нет доступа к Астре на платном тарифе. Альтман отдельно извинился за кривой запуск — блог-пост успел выйти, пропасть и вернуться. Ожидаю, что к моменту теста у меня накопится лимитов штук пять.

🚀 Бенчмарки рвут, но со звёздочкой

99,9% на ARC-AGI-3 — цифра из анонса. В сноске: прогон шёл на responses API harness от OpenAI, который «меняет две настройки, чтобы лучше соответствовать реальной работе».

ARC Prize выложили обе цифры честно: 62,7% на стандартной обвязке за 26 098 $ и 99,9% на провайдерской за 18 817 $. А в таблице OpenAI рядом с 99,9% стоит Opus 5 с его 30,2%. По сути там только сохранение рассуждений между вызовами + компактизация.

😀 Обе цифры настоящие. Только 62,7% — это про модель, а 99,9% — про модель вместе с обвязкой.


⚙️ Планка задрана, но не везде

Computer use Astra действительно забирает: OSWorld 2.0 — 72,6% против 65,7% у Sol, и на 47% меньше времени на задачу.

Кибербез — 100% на ExploitBench получены без продакшен-защит. Тут я слабо разбираюсь в вопросе, поэтому просто поверю на слово, что стало круто.

А про это в анонсе не написали вообще:

— Humanity's Last Exam: 57,2% у Astra против 65,0% у Fable 5.1
— Artificial Analysis Intelligence Index: 61,2 у Astra, 60,9 у Sol, 63,1 у Opus 5, 65,7 у Fable 5.1

Прирост над собственным предшественником — 0,3 пункта.

💰 Сколько это стоит

За миллион токенов, вход / выход:

- GPT-6 Astra — 10 $ / 50 $
- Astra на контексте от 272 000 токенов — 20 $ / 75 $, причём за весь запрос целиком, а не за превышение
- Astra в Fast mode — 20 $ / 100 $
- GPT-5.6 Sol — 4 $ / 20 $
- Claude Fable 5.1 — 10 $ / 50 $
- Claude Opus 5 — 5 $ / 25 $
- Gemini 3.1 Pro — 2 $ / 12 $

Astra ровно вдвое дороже Opus 5 и в 2,5 раза дороже собственного Sol. С Fable 5.1 паритет по прайсу, но чтение из кэша у Astra стоит 1 $ против 0,25 $ — на агентских циклах, которые перечитывают контекст каждый шаг, разница набегает быстро.

Кто уже получил доступ и гонял Astra на своих задачах — на чём она реально обошла Opus 5 или Fable 5.1?

В комментарии кину видео-сравнение генерации в Blender с твиттера.

----

Поляков считает — AI, код и кейсы
  • 👍 7
  • ❤ 5
  • 🔥 3
More from @countwithsasha
  1. Sep 19, 2026SEO-аудит. Затестил скилл разработчика из Кишинева и мне очень зашло Я периодически расска…
  2. Sep 17, 2026Весной рассказывал про реддит-скилл. Но не рассказал, что моё приложение быстро забанили К…
  3. Sep 16, 2026Немного про пет-проекты в области ИИ Месяц назад мы с командой единомышленников без лишних…
  4. Sep 15, 2026Скилл Яндекс.Директа: что добавил за неделю после релиза На прошлой неделе я выложил скилл…
  5. Sep 11, 2026Диплинки в кодинговых агентах Deeplinks - простой, но иногда незаменимый прием для быстрог…
  6. Sep 11, 2026Плюсую теме, которую поднимает Рефат. Диплинки в кодинговых агентах реально круто упрощают…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →