MWS AI Vision Bench — наш открытый бенчмарк для оценки мультимодальных моделей на русскоязычных документах. Он показывает, насколько хорошо модели распознают текст, восстанавливают структуру страниц, извлекают данные и отвечают на вопросы по содержимому. На этом бенчмарке мы тестируем в том числе наши собственные большие языковые модели Cotype (доступны в MWS AI Agents Platform).
Теперь мы дополнили бенчмарк экспериментальной категорией Anti-fraud, которая показывает, замечают ли универсальные модели изменения в документах и могут ли объяснить, что именно вызвало подозрение.
⚡️ В новый датасет вошли 430 изображений:
- 200 исходных
- 130 с ручными правками
- 100 пересозданных генеративной моделью.
⚡️ Половина итогового балла зависит от правильной классификации, вторая — от того, насколько точно модель указала изменённые элементы.
⚡️ Мы также уточнили формулировки и допустимые ответы в 395 из 400 заданий VQA, чтобы случайные совпадения меньше влияли на результаты.
Категория Anti-fraud не заменяет профессиональные системы защиты от мошенничества и не входит в общий балл бенчмарка. Она помогает предварительно сравнить универсальные модели и понять, насколько хорошо они замечают вмешательство в документы.
Разбор обновлений в MWS AI Vision Bench, лидерборд и примеры заданий собрали в новой статье на Хабре 🗒
