🤔 GPT-5.6 Sol уже обогнал Opus 5 на ARC-AGI-3? Не совсем
В официальном рейтинге лидер остаётся прежним:
• Claude Opus 5 - 30,2%
• GPT-5.6 Sol - 7,8%
Но ARC-AGI-3 оценивает не только саму модель. Агент должен изучать незнакомые 2D-игры методом проб и ошибок, а результат зависит от памяти, управления контекстом и тестового harness.
Стандартный harness не переносит скрытые рассуждения модели между ходами. Когда история превышает примерно 175 000 символов, самые старые взаимодействия удаляются.
OpenAI запустила Sol через Responses API с сохранением рассуждений и Compaction - механизмом, который сжимает старый контекст вместо его удаления.
На публичных играх результат вырос:
13,3% → 38,3%
При этом модель использовала в шесть раз меньше выходных токенов.
Но это ещё не доказывает превосходство над Opus 5: 38,3% получены на публичном наборе с кастомным harness, а 30,2% Opus 5 - официальный результат в стандартных условиях.
https://x.com/Machinelearrn/status/2082761183732363729
Post #2912
4.06K


- ❤ 9
- 👍 6
- 🔥 5
- 🫡 1