TGViewer
Data Secrets Data Secrets @data_secrets · 94.2K subscribers
Post #9639 26K
Как две галочки в API утроили результат GPT-5.6 на ARC-AGI-3

Очень занятное исследование выпустили сегодня OpenAI. В двух словах: иногда важнее как мы тестируем, а не что мы тестируем. Но обо всем по порядку.

Когда вышла GPT-5.6 Sol, результаты на ARC-AGI-3 для такой сильной модели оказались подозрительно слабыми – всего 7.8%. И это при том, что Sol хорошо прошла Pokémon FireRed и решила, например, гипотезу о двойном покрытии циклов. В общем, команда решила разобраться, в чем дело.

Напоминаем, что ARC-AGI-3 – это бенчмарк для агентов. Соответственно, модели для взаимодействия со средой нужна какая-то обвязка – харнесс – которая определяет, что модель видит на каждом шаге, как вызываются инструменты, что происходит с контекстом и тд. Ожидаемо, среда ARC-AGI-3 использует максимально простой универсальный харнесс, чтобы честно сравнивать модели между собой. Но для OpenAI именно в этой универсальности и оказалась зарыта собака.

Во-первых, после каждого действия в игре весь приватный ризонинг модели просто удалялся, так что Sol не видел собственных планов и рассуждений с прошлых шагов. Во-вторых, из-за использования скользящего окна по мере роста истории любые старые действия становились для модели невидимыми.

Но дело в том, что Sol была специально обучена именно с сохранением ризонинга между шагами. Харнесс эту фишку отрубил, и результаты посыпались.

А теперь внимание на график наверху. Зеленое – это результаты модели на public сете ARC-AGI-3 на официальном харнессе. А синее – на харнессе, в котором просто включили сохранение ризонинга между вызовами и заменили грубое обрезание истории на сжатие контекста (те же настройки используются в продакшене ChatGPT и Codex). 38.3% против 13.3%, и при этом расход токенов на вывод снизился в 6 раз. Для сравнения, средний результат человека – 48%.

Мораль от OpenAI: бенчмарк меряет не только модель, но и то, как именно ее используют. Как минимум, давно пора на подобных бенчмарках использовать Responses API вместо седого Chat Completions.
  • ❤ 126
  • 🔥 49
  • 👍 18
  • 😁 9
More from @data_secrets
  1. Sep 28, 2026Вышел Sonnet-5.5! Главное: по бенчмаркам модель лучше GPT-6 Sol и довольно плотно подобрал…
  2. Sep 28, 2026С минуты на минуту выходит новый Sonnet-5.5 Стоить будет ровно столько же, сколько GPT-6 S…
  3. Sep 28, 2026Джеффри Хинтон, Йошуа Бенджио, Якуб Пахоцки из OpenAI, Джек Кларк из Anthropic и еще 18 оч…
  4. Sep 28, 2026🦾 Практический RecSys: собери рекомендательную ленту с помощью ML — на бесплатном вебинар…
  5. Sep 28, 2026Все настолько любят ресеты от Тибо, что даже 6 точек от него набирают миллионы просмотров…
  6. Sep 28, 2026В Твиттере заметили, что Андрей Карпаты ничего не постит уже 2 месяца, хотя раньше делал э…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →