Современные мультимодальные модели умеют анализировать видео, однако их ответы на пространственно-временные вопросы часто остаются недостаточно надежными. Для таких вопросов важно понимать не только, какие объекты присутствуют в сцене, но и где они находятся относительно друг друга, как перемещаются и как меняются их отношения во времени. Для повышения качества ответов предлагается использовать графы сцены как структурированное представление видео: объекты описываются вершинами графа, а отношения между ними — ребрами. Это позволяет явно хранить информацию о взаимном расположении объектов и использовать ее для более точных ответов на вопросы.
В рамках семинара будет рассмотрено, какие сложности возникают при ответах на пространственные вопросы по видео, как строятся графы сцены и как они могут применяться для задачи Visual Question Answering.
👉🏻 Дата: 04.06.26, четверг в 17:00
📹 Трансляция: ВК или YouTube
Подключайтесь к живому обсуждению и задавайте вопросы в прямом эфире! Ждем всех!
#семинары #CV
