🎓 — Семинар 4. Генерация графов сцены с помощью VLM| Владислав Макаров, Марк Гизетдинов
Цель генерации графов сцены (SGG) — по изображению или кадрам видео получать структурированное описание сцены: объекты с границами (bounding box), отношения между ними и их атрибуты. Такое представление нужно для задач понимания сцен, робототехники и видеоаналитики.
Основная сложность — научить модель стабильно выдавать корректные, согласованные графы в нужном формате при разнообразии сцен и датасетов. Типичные пайплайны (детекция + классификация связей) требуют отдельных модулей и сложной постобработки, плохо масштабируются на новые домены и форматы. Обученные «из коробки» VLM на тексте и картинках не решают задачу SGG напрямую: модель нужно целенаправленно дообучать под генерацию графов сцен с контролем формата вывода и метрик качества.
Отдельное внимание следует уделять времени ответа модели. Цель — получать граф сцены менее чем за секунду. Для этого используется компактный формат вывода TOON и инференс через акселераторы (в частности, vLLM), что позволяет увеличить быстродействие при сохранении качества разметки.
На семинаре студент магистратуры ЦКМ представит общий обзор современных подходов генерации графов сцены на базе VLM. Отдельно будут рассмотрены технологии обучения таких моделей: supervised fine-tuning (SFT) и обучение с подкреплением (GRPO) на датасетах PSG и PVSG.
👉🏻 Дата: 26.02.26, четверг в 17:00
📹 Трансляция: Youtube или ВК
Подключайтесь к живому обсуждению и задавайте вопросы в прямом эфире. Ждём всех!
#CV
Post #1086
1.6K

- ❤ 3
- 🔥 2