Чтобы понять, действительно ли ИИ справился с поручением, команды AGI NLP и Computer Operator представили WebPageBench — открытый бенчмарк для оценки работы веб-агентов на 152 повседневных задачах.
Агенты выполняют их на шести русскоязычных моках сайтов 🤩
🟣 Покупают товары
🟣 Бронируют отели
🟣 Ищут билеты
🟣 Работают с файлами и корзиной
Так можно отделить ошибки в понимании задания от проблем с конкретной реализацией интерфейса. Большинство существующих бенчмарков использует англоязычные интерфейсы, тогда как WebPageBench работает с русскоязычными 🔥
Все действия агента сайт записывает в лог событий. По нему система определяет, была ли задача выполнена успешно.
Ждать отмашки от самого агента или использовать LLM-судью не нужно 🤩
WebPageBench также проверяет, как агент справляется с разными реализациями одного и того же элемента интерфейса, например календаря, счётчика или выпадающего списка.
В публичном лидерборде уже 24 связки моделей и обвязок. Проект находится в открытом доступе, его можно запустить локально и добавить собственную модель или обвязку.
Код и инструкции — на GitHub
✔️ Подписывайтесь на Sber AI в МАКС
