Доклад посвящён real-time open-vocabulary 3D сегментации и реконструкции сцен. В отличие от классических методов, работающих с фиксированным набором классов, open-vocabulary подход позволяет выделять произвольные объекты по текстовому описанию без дообучения. Особый интерес представляют решения, способные работать онлайн, по мере поступления данных, что критично для робототехники, AR/VR и автономных систем.
В докладе анализируются передовые подходы к монокулярной 3D-реконструкции (Pi3, Depth-Anything 3), а также методы комбинирования языковых, визуальных и геометрических признаков для точного выделения объектов по текстовым запросам, включающим пространственные отношения: "стул рядом с холодильником", "свечка на столе", "чашка справа от чайника", "полотенце, но не на стуле" (RADIOv2.5, Talk2DINO, MVGGT). Рассматриваются бенчмарки для данной задачи.
В заключительной части обсуждается перспективное решение, способное обобщать пространственные признаки в токены, размерность которых не зависит от числа входных кадров (SceneTok).
👉🏻 Дата: 23.04.26, четверг в 17:00
📹 Трансляция: Youtube или ВК
Подключайтесь к живому обсуждению и задавайте вопросы в прямом эфире! Ждем всех!
#семинары #CV
