Начинаем рассказ о серии наших работ, принятых на ICRA 2026, c RADIO-ViPE - той самой, которую мы недавно просили поддержать, и которая благодаря вашим голосам вошла в топ-3 в номинации "Paper of the Day" на Hugging Face.
🏆 RADIO-ViPE (Reduce All Domains Into One — Video Pose Engine) — это онлайн-система семантического SLAM, которая привносит понимание сцены с открытым словарем в динамические среды — напрямую из монокулярного RGB-видео.
Ключевые идеи:
🔹Использование агломеративной модели (это когда в одну модуль дистиллируют на основе метода учитель-ученик способности энкодеров, работающих по разным принципов) для тесного комплексирование (tightly-coupled fusion) разных способов представления информации об окружении.
🔹 Временно согласованные адаптивные робастные ядра (adaptive robust kernel) численной оптимизации, которые позволяют обеспечить лучшую ассоциацию данных внутри процедуры локализации. Работают на основе оценивания статичности/подвижности визуальных признаков и семантической информации.
🔹 Система с открытым исходным кодом, работающая в режиме онлайн по данным обычных цветных камер без датчиков глубины, не требуя калибровки (или априорного знания) параметров и инициализации положения камеры.
Другими словами, с помощью RADIO-ViPE можно не только строить системы локализации и семантической навигации для роботов, но и получать быстро и дешево обучающие и валидационные датасеты на основе видео со сторонних видеохостингов. Одно из крайне перспективных применений сейчас, потому что для воплощения интеллекта нужно много дата-топлива для обучения моделей.
🤝 Команда: Жаафар Махмуд, Заид Нассер (магистрант), Тианхао Ли (магистрант), Михаил Юманов (бакалавр), Максим Попов (аспирант) и Сергей Колюбин
👨💻 Страница проекта
🎓Препринт
🗣 Где расскажем
🏛 Другие проекты нашей лабы
Post #59
328