CMU показали Gym-Anything: подход, который превращает почти любое ПО в среду для обучения и оценки AI-агентов.
Это важно, потому что реальная работа в приложениях редко похожа на маленькие web-задачи из бенчмарков. В рабочих программах длинные сценарии, грязные состояния, разные интерфейсы, файлы, ошибки установки, странные настройки и много шагов, где агент легко теряется.
Gym-Anything пытается убрать главный bottleneck: ручную сборку таких сред. Один агент сам ставит приложение, пишет скрипты, загружает данные, открывает софт и собирает доказательства, что окружение реально работает. Второй агент проверяет это через скриншоты, логи, файлы и чеклисты. Если setup слабый, он отправляет задачу на исправление.
На этой схеме авторы собрали CUA-World: больше 10 000 задач в 200 приложениях, покрывающих все 22 крупные группы профессий.
Самый адекватный результат: когда задачи становятся похожи на настоящую работу, даже сильные агенты часто проваливаются. Особенно на длинных сценариях, где нужно держать контекст, пользоваться интерфейсом, проверять результат и восстанавливаться после ошибок.
Paper: Gym-Anything: Turn any Software into an Agent Environment
https://arxiv.org/abs/2604.06126
Post #5422
4.81K


- ❤ 8
- 👍 3