VLC-BERT: Visual Question Answering with Contextualized Commonsense Knowledge
Относительно новая работа VLC-BERT (Visual Language Commonsense) от University of British Columbia для решения задачи VQA. Особенность заключается в том, что вместо типичного подхода с извлечением знаний (knowledge-based) авторы применяют доп reasoning языковую модель commonsense - COMET, которая предобучена на гарфах знаний. COMET на вход принимает вопрос и лэйблы объектов, обнаруженных на изображении моделью YOLOv5.
В результате модель COMET формирует ряд предложений, который содердит дополнительную описательную информацию об изображении. Для каждого из 30 типов «отношений» формируется топ-5 предложений, далее они еще фильтруются и получается финальный список дополнительных описаний, который подаётся на вход вместе с текстом вопроса и image regions в финальную архитектуру VLC-BERT, которая была предобучена на VQA датасетах.
Итого модель содержит 118М параметров и выбивает по accuracy все knowledge-based решения (43.14%).
Подробнее в статье
Пощупать модель можно в репозитории
@complete_ai
Post #47
1.31K

- 👍 9
- 👏 2