TGViewer
Sber AI Sber AI @sberaiscience · 27K subscribers
Post #4531 2.49K
Агент сказал, что всё сделал. Верим? 🤩

Чтобы понять, действительно ли ИИ справился с поручением, команды AGI NLP и Computer Operator представили WebPageBench — открытый бенчмарк для оценки работы веб-агентов на 152 повседневных задачах.

Агенты выполняют их на шести русскоязычных моках сайтов 🤩
🟣 Покупают товары
🟣 Бронируют отели
🟣 Ищут билеты
🟣 Работают с файлами и корзиной


Так можно отделить ошибки в понимании задания от проблем с конкретной реализацией интерфейса. Большинство существующих бенчмарков использует англоязычные интерфейсы, тогда как WebPageBench работает с русскоязычными 🔥

Все действия агента сайт записывает в лог событий. По нему система определяет, была ли задача выполнена успешно.

Ждать отмашки от самого агента или использовать LLM-судью не нужно 🤩


WebPageBench также проверяет, как агент справляется с разными реализациями одного и того же элемента интерфейса, например календаря, счётчика или выпадающего списка.

В публичном лидерборде уже 24 связки моделей и обвязок. Проект находится в открытом доступе, его можно запустить локально и добавить собственную модель или обвязку.

Код и инструкции — на GitHub


✔️ Подписывайтесь на Sber AI в МАКС
  • 👍 67
  • 🔥 41
  • 😍 25
  • ❤ 21
  • 👏 18
More from @sberaiscience
  1. Oct 2, 2026Post #4530
  2. Oct 2, 2026Post #4529
  3. Oct 1, 2026ПРАКТИКА И ТОЛЬКО ПРАКТИКА 🤩 16 октября состоится открытый инженерный день ГигаКонф, посв…
  4. Oct 1, 2026Post #4527
  5. Sep 30, 2026Сможет ли 🆗 придумать то, чего ещё не существует? На сессии Люк Бессон и представители кр…
  6. Sep 30, 2026Post #4525
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →