Не знаю почему, но вот не задались мои отношения с семейством GPT. Для меня компания и ее продукты, это котенок, утверждающий, что он лев. Красивый, милый, но пока к лотку не приучен.
Уверена, что все мы любим читать статьи о новых моделях, где капсом написано "БЬЕТ ФРОНТИРЫ ПО ВСЕМ БЕНЧМАРКАМ". Да, опять и снова. Пусть то Llama, Qwen, Mistral, GPT и тд. НО теперь я в первую очередь иду читать про то, КАК замеряли, КТО замерял и КАКИЕ датасеты использовались.
3 сентября вышла новая модель от OpenAI, которая уже может (якобы) сама принимать решения и адаптироваться к новым задачам. Например, вы загружаете агента в незнакомую ему игру, и он действительно находит цели игры и проходит ее.
Не все так просто. Читала на выходных публикации по Astra, хотела обновить свою табличку моделей. Собрала, где вопросики.
ВИТРИНА РЕЛИЗА
Официальные цифры такие. На агентном кодинге Terminal-Bench 57,9 процента против 37,3 у прошлой модели Sol и 55,8 у Fable 5.1. На работе с компьютером OSWorld 72,6 против 65,7 и 70,2. На кликах по интерфейсу ScreenSpot-Pro 92,7 против 76,9 и 87,3. На математике FrontierMath 97,6 против 83 у обеих. На поиске уязвимостей ExploitBench вообще 100 процентов.
Цена прежняя для флагмана: 10 долларов за миллион входных токенов и 50 за миллион выходных.
Красиво. Теперь про то, как эти числа получены.
ЦИФРЫ МЕНЯЛИ ПОСЛЕ ПУБЛИКАЦИИ
Пост OpenAI вышел 3 сентября в 14:23 по восточному времени. К 17:20 часть цифр стала другой. Правки в основном в пользу Astra и против Anthropic. Может, я и душнила, но.
Доля выдумок у Astra была 4,2 процента, стала 2,0, потом снова 4,2. У Sol была 12,2, стала 9,4, потом снова 12,2.
FrontierMath у Fable: было 87,8, стало 78,0, сейчас 83,0. У Sol: 83,0, потом 80,5, сейчас снова 83,0.
ExploitBench у Sol: было 5,5, стало 11,5, сейчас пересматривают. Terminal-Bench у Astra подрос с 57,7 до 57,9.
А в предрелизном черновике на ARC-AGI-3 у Astra стояло 98,6. Сейчас 99,99.
ЧТО МЕШАЕТ СРАВНИВАТЬ
Первое. Эталон снят с конфигурации, которую нельзя купить. Результат Sol в 11,5 процента на ExploitBench получен на недоступном уровне рассуждений. OpenAI это признала и обсуждает откат к 5,5. То есть "мы самые лучшие, но вы это не проверите"🥰
Второе. В блоге стоит оговорка: все оценки это максимум при любом уровне усилий. Цифры сняты в лучших условиях и могут отличаться от того, что работает в продукте. "И параметры вам не видать"🥰🥰
Третье. В системной карте почти нет описания внутреннего теста на выдумки. Анка Ройель и Майк Харди из Стэнфорда пишут, что не указано даже количество тестовых элементов 🥰🥰🥰 Перепрогоны с разными условиями они называют подгонкой под тесты.
Про процесс внутри тоже важно. Метрики считают разные команды и передают центральной на публикацию. Общего контроля методологии нет. Чужие модели OpenAI обычно не прогоняет сама, а берет числа с открытых рейтингов.
Сверку по архивным снимкам сделал
FortuneРазбор
системной карты