«NVIDIA решила ARC-AGI-3» или не совсем ?
Сейчас по сети расходится громкий результат NVIDIA, но сравнение оказалось запутаннее заголовков.
Результат NVIDIA получен на публичном наборе ARC-AGI-3, а не на закрытом/semi-private бенчмарке, который используется для официального leaderboard. Сам ARC Prize прямо предупреждает, что public set проще и не должен использоваться как официальный показатель прогресса.
Плюс речь идёт не просто о «модели NVIDIA»: агентная система использует Claude Opus 5 внутри harness.
А знаменитые 30,16% Opus 5 - это как раз подтверждённый результат на semi-private evaluation, а не сопоставимый score на public set.
Поэтому сравнивать эти цифры напрямую нельзя: разные наборы задач + разные agent harness.
https://developer.nvidia.com/blog/nvidia-avo-reaches-100-on-arc-agi-3-demonstrating-a-frontier-level-general-purpose-architecture-for-long-horizon-autonomous-agents/
Post #5639
4.73K

- ❤ 8
- 👍 3
- 🔥 3