ARC-AGI-3 вийшов як інтерактивний бенчмарк саме для агентів
Замість статичних задач — середовища, де агент має вчитись по ходу, планувати довгі кроки й адаптуватись. Спробував перше завдання - це гра. І GPT5.4 нічого не зрозумів що там робити)) спробуйте теж
Чому важливо для агентів: це ближче до реального production-патерну «план → дія → фідбек → корекція», тобто краще міряє агентну придатність, ніж одноразові Q/A-бенчмарки
Post #1708
486
Hacker News ARC-AGI-3 (Score: 158+ in 4 hours) Link: https://readhacker.news/s/6QBrY Comments: https://readhacker.news/c/6QBrY https://arcprize.org/media/ARC_AGI_3_Technical_Report.pdf