Постоянно обновляемый отчет от Open AI тут, но видимо столько желающих, что прорваться непросто. Там куча вилосов по генерациям игр, конструктивных задач, визуала и тд и тп. В общем, приятных просмотров. (еще полезно обратить внимание, что все скоиится не только по рехультату, но по его цене - это прям обнадеживает)
"Ты знаешь, небо становятся ближе, с каждым днем" (с)
АПД: вот тут разбор, как Астра добилась 99,9% в ARC-AGI-3 , при среднем результате кожаного 49,14%
ARC-AGI-3 — это бенчмарк для оценки способности ИИ-агентов учиться и рассуждать. Агенты исследуют незнакомые двумерные игры и без явных инструкций выясняют, как они устроены.






