🏆 AgentGrounder — это фреймворк для решения задачи zero-shot 3D visual grounding, т.е. поиска объекта внутри сцены по текстовому запросу на естественном языке без дополнительного обучения.
Ключевые идеи:
🔹 Двухэтапный агентный конвейер с офлайн построением таблицы объектов (Object Lookup Table) и онлайн-агентом, который разлагает запрос на подзадачи и находит релевантные объекты;
🔹 Агент имеет в своем распоряжении инструменты геометрического рассуждения и генерации новых видов напрямую из облака точек;
🔹 Использование фундаментальных визуально-языковых моделей (LVLM), что позволяет использовать фреймворк без дополнительного обучения.
Используя связку AgentGrounder с методом семантического картирования (например, с нашим же RADIO-ViPE), мы можем находить объекты в любых сценах по любым текстовым запросам, даже сильно запутанным. Так наш подход не только делает роботов умнее, но и имеет множество других применений: от использования в VR/AR до помощи в редактировании 3D контента.
🤝 Команда проекта: Куонг Хюинь (магистрант), Максим Попов (аспирант), Денис Гридусов (бакалавр), Сергей Колюбин
👨💻 Страница проекта
🎓 Препринт
🏛 Другие проекты нашей лабы
Post #68
331

- ❤ 7
- 🔥 1