В начале сентября в Неаполе (Италия) на конференции ECML PKDD 2026 в рамках воркшопа SynDAiTE была представлена работа исследователей 💻💻💻 MechFaithBench: A Counterfactual Benchmark for Visual Grounding Diagnostics in Vision-Language Models.
💻 MechFaithBench — это бенчмарк для оценки визуальной обоснованности ответов мультимодальных моделей. Он проверяет не только то, правильно ли VLM отвечает на вопрос об изображении, но и действительно ли ответ опирается на нужную визуальную информацию.
«Для нас визуальная достоверность — это не только правильный ответ, но и правильное визуальное основание для него. В MechFaithBench мы проверяем это через визуальный граундинг. Такая диагностика может стать основой для следующего шага — управления визуальным граундингом и его целенаправленного усиления»,
— рассказывает Альбина Бурлова, старший преподаватель ФКН НИУ ВШЭ и один из авторов работы.
⭐️На SynDAiTE исследование представил коллега авторов Сергей Плетенев из AIRI/Сколтех. Работа была отобрана для pitch-презентации и постерной сессии.
Работу подготовили:
⚪️Альбина Бурлова и Елена Тутубалина — сотрудницы лаборатории моделей и методов вычислительной прагматики ФКН
⚪️Елизавета Шарова — выпускница магистратуры «Искусственный интеллект» ФКН
⚪️Дарья Пугачёва — исследовательница лаборатории методов анализа больших данных (LAMBDA) ФКН
Сейчас статья проходит рецензирование в ACL Rolling Review (ARR), поэтому ознакомиться с полной версией исследования можно будет позже.
С любопытством следим за коллегами и радуемся успехам ❤️

