Что умеет GPT-6 Astra и что показали независимые тесты
#ai #ии #openai #astra #бенчмарки #аналитика
Независимые тесты GPT-6 Astra за первую неделю после релиза. Интересны расхождения между анонсом и тем, что намерили сторонние площадки.
ARC-AGI-3, три конфигурации. Стандартная среда с максимальным рассуждением — 62,7%. С адаптером OpenAI — 98,6%. С адаптером на уровне high — 99,9%. Адаптер хранит состояние рассуждений между запросами и сжимает историю. Тридцать семь пунктов дала обвязка при том же уровне рассуждения.
Artificial Analysis в версии 4.2 ставит Astra второй, первой идёт Claude Fable 5.1. У Epoch в ECI наоборот — Astra первая со 169 баллами, правда интервалы неопределённости у моделей пересекаются. В ToneBench, где сравнивают письмо, Astra с настройками по умолчанию на 41-м месте, её собственная предшественница Sol на 20-м.
На FrontierMath: Erdős из 68 проблем, открытых на август 2026-го, Astra решила две. Sol, GPT-5.5, Fable 5.1 и Fable 5 — ни одной. Один контрпример обошёлся в 15 часов и 218 долларов, суммарно на все попытки ушло больше 220 тысяч. Три процента тут весят больше, чем девяносто семь на задачах с готовым ответом.
Читать подробней
Life-Hack - AI
Post #690
299

- ❤ 3
- 👍 1
- 🔥 1