self-supervised-depth-estimation
В репозитории представлен код к работе по самопроверочному восстановлению глубины с учетом временной информации и механизмов внимания. Авторы рассматривают задачу оценки глубины по видеопоследовательности с одной камеры, где модель одновременно восстанавливает структуру сцены и движение камеры, обучаясь только на видеорядах без карт истинной глубины. Базой служит классический self-supervised pipeline в духе Monodepth2. Отдельные сети предсказывают карту глубины и относительные позы между кадрами, а модель обучается по фотометрической ошибке между реальным кадром и синтезированным с помощью геометрических преобразований. Эксперименты на наборе KITTI показывают, что предложенные модификации улучшают качество относительно базовой Monodepth2 по ключевой метрике RMSE и дают особенно выигрыши на удалённых объектах и областях с большой вариацией глубины. Последовательный режим работы, когда на тесте модель прокручивает несколько предыдущих кадров, дополнительно снижает ошибки. Работа будет полезна исследователям в области компьютерного зрения и робототехники, инженерам, занимающимся системами помощи водителю и автономным вождением, а также разработчикам AR-и VR-приложений, где требуется оценка глубины в реальном времени из видеопотока.
статья | код
Post #141
482

- ❤ 4
- 🔥 3
- 👍 2