TGViewer
Machine learning Interview Machine learning Interview @machinelearning_interview · 30.3K subscribers
Post #2912 4.06K
🤔 GPT-5.6 Sol уже обогнал Opus 5 на ARC-AGI-3? Не совсем

В официальном рейтинге лидер остаётся прежним:

Claude Opus 5 - 30,2%
GPT-5.6 Sol - 7,8%

Но ARC-AGI-3 оценивает не только саму модель. Агент должен изучать незнакомые 2D-игры методом проб и ошибок, а результат зависит от памяти, управления контекстом и тестового harness.

Стандартный harness не переносит скрытые рассуждения модели между ходами. Когда история превышает примерно 175 000 символов, самые старые взаимодействия удаляются.

OpenAI запустила Sol через Responses API с сохранением рассуждений и Compaction - механизмом, который сжимает старый контекст вместо его удаления.

На публичных играх результат вырос:

13,3% → 38,3%

При этом модель использовала в шесть раз меньше выходных токенов.

Но это ещё не доказывает превосходство над Opus 5: 38,3% получены на публичном наборе с кастомным harness, а 30,2% Opus 5 - официальный результат в стандартных условиях.

https://x.com/Machinelearrn/status/2082761183732363729
  • ❤ 9
  • 👍 6
  • 🔥 5
  • 🫡 1
More from @machinelearning_interview
  1. Sep 21, 2026SoftBank привлекает более $11 млрд ради новой инвестиции в OpenAI 🚨 SoftBank запустила ра…
  2. Sep 21, 2026Один вечер — много возможностей! ⚡️ 25 сентября у тебя будет шанс познакомиться сразу с че…
  3. Sep 21, 2026🔥 Hemmingway-1 - открытая модель, которая пытается писать как человек Модель построена на…
  4. Sep 20, 2026💰 Инвесторы допускают оценку Anthropic в $4 трлн после IPO, но дешёвые модели усиливают д…
  5. Sep 18, 2026photo post
  6. Sep 18, 202617 сентября в Москве прошла AI R&D DAY — конференция для исследовательских команд и создат…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →