Post #530
255
Открыт и идет сбор заявок в нашу магистратуру на Физтехе
IM @imapday
Showing posts older than #531 · Back to latest
Forwarded from Center for Cognitive Modeling

Доклад посвящён real-time open-vocabulary 3D сегментации и реконструкции сцен. В отличие от классических методов, работающих с фиксированным набором классов, open-vocabulary подход позволяет выделять произвольные объекты по текстовому описанию без дообучения. Особый интерес представляют решения, способные работать онлайн, по мере поступления данных, что критично для робототехники, AR/VR и автономных систем.
В докладе анализируются передовые подходы к монокулярной 3D-реконструкции (Pi3, Depth-Anything 3), а также методы комбинирования языковых, визуальных и геометрических признаков для точного выделения объектов по текстовым запросам, включающим пространственные отношения: "стул рядом с холодильником", "свечка на столе", "чашка справа от чайника", "полотенце, но не на стуле" (RADIOv2.5, Talk2DINO, MVGGT). Рассматриваются бенчмарки для данной задачи.
В заключительной части обсуждается перспективное решение, способное обобщать пространственные признаки в токены, размерность которых не зависит от числа входных кадров (SceneTok).
























