TGViewer
LLM-стройка LLM-стройка @llm_stroyka · 79 subscribers
Post #12 79
Штош, GPT-6 Astra: шаг в AGI или мы все еще незаменимы

Не знаю почему, но вот не задались мои отношения с семейством GPT. Для меня компания и ее продукты, это котенок, утверждающий, что он лев. Красивый, милый, но пока к лотку не приучен.

Уверена, что все мы любим читать статьи о новых моделях, где капсом написано "БЬЕТ ФРОНТИРЫ ПО ВСЕМ БЕНЧМАРКАМ". Да, опять и снова. Пусть то Llama, Qwen, Mistral, GPT и тд. НО теперь я в первую очередь иду читать про то, КАК замеряли, КТО замерял и КАКИЕ датасеты использовались.

3 сентября вышла новая модель от OpenAI, которая уже может (якобы) сама принимать решения и адаптироваться к новым задачам. Например, вы загружаете агента в незнакомую ему игру, и он действительно находит цели игры и проходит ее.

Не все так просто. Читала на выходных публикации по Astra, хотела обновить свою табличку моделей. Собрала, где вопросики.

ВИТРИНА РЕЛИЗА

Официальные цифры такие. На агентном кодинге Terminal-Bench 57,9 процента против 37,3 у прошлой модели Sol и 55,8 у Fable 5.1. На работе с компьютером OSWorld 72,6 против 65,7 и 70,2. На кликах по интерфейсу ScreenSpot-Pro 92,7 против 76,9 и 87,3. На математике FrontierMath 97,6 против 83 у обеих. На поиске уязвимостей ExploitBench вообще 100 процентов.

Цена прежняя для флагмана: 10 долларов за миллион входных токенов и 50 за миллион выходных.

Красиво. Теперь про то, как эти числа получены.

ЦИФРЫ МЕНЯЛИ ПОСЛЕ ПУБЛИКАЦИИ

Пост OpenAI вышел 3 сентября в 14:23 по восточному времени. К 17:20 часть цифр стала другой. Правки в основном в пользу Astra и против Anthropic. Может, я и душнила, но.

Доля выдумок у Astra была 4,2 процента, стала 2,0, потом снова 4,2. У Sol была 12,2, стала 9,4, потом снова 12,2.

FrontierMath у Fable: было 87,8, стало 78,0, сейчас 83,0. У Sol: 83,0, потом 80,5, сейчас снова 83,0.

ExploitBench у Sol: было 5,5, стало 11,5, сейчас пересматривают. Terminal-Bench у Astra подрос с 57,7 до 57,9.

А в предрелизном черновике на ARC-AGI-3 у Astra стояло 98,6. Сейчас 99,99.

ЧТО МЕШАЕТ СРАВНИВАТЬ

Первое. Эталон снят с конфигурации, которую нельзя купить. Результат Sol в 11,5 процента на ExploitBench получен на недоступном уровне рассуждений. OpenAI это признала и обсуждает откат к 5,5. То есть "мы самые лучшие, но вы это не проверите"🥰

Второе. В блоге стоит оговорка: все оценки это максимум при любом уровне усилий. Цифры сняты в лучших условиях и могут отличаться от того, что работает в продукте. "И параметры вам не видать"🥰🥰

Третье. В системной карте почти нет описания внутреннего теста на выдумки. Анка Ройель и Майк Харди из Стэнфорда пишут, что не указано даже количество тестовых элементов 🥰🥰🥰 Перепрогоны с разными условиями они называют подгонкой под тесты.

Про процесс внутри тоже важно. Метрики считают разные команды и передают центральной на публикацию. Общего контроля методологии нет. Чужие модели OpenAI обычно не прогоняет сама, а берет числа с открытых рейтингов.

Сверку по архивным снимкам сделал Fortune
Разбор системной карты
  • 👨‍💻 2
  • 🔥 1
More from @llm_stroyka
  1. Sep 18, 2026Иногда все идет не по плану😭 Вчера проводила встречу по ИИ-агентам, но нигде не было инте…
  2. Sep 15, 2026Давайте избавимся от рутины ⭐️ Проводим воркшоп с Натальей Грековой — каждый соберет ИИ-по…
  3. Sep 15, 2026В этот четверг буду рассказывать про агентов и ассистентов. Приходите обязательно 🥰
  4. Sep 15, 2026Привет! Это «ЛЛМ для пупсиков»🍼 Я Ната, делаю ИИ-агентов и системы на языковых моделях. У…
  5. Sep 15, 2026А еще я запустила канал, где пишу о ИИ для новичков, присоединяйтесь, если в этом чате вам…
  6. Sep 15, 2026LLM-стройка pinned «Решила написать, с чем я могу помочь, вдруг вы не знаете😈 Я собираю L…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →