Подсвечу характерный тренд в 3D-компьютерном зрении - активно появляются трансформерные методы реконструкции трехмерной карты с одновременной оценкой позы камеры и, в последнее время, с генерацией параметров гауссиан. Из наиболее характерных работ: в начале года появилась и впечатлила всех модель VGGT (University of Oxford, Meta AI), затем разработали более быструю модель Pi3 (Shanghai AI Lab), в прошлом месяце вышла модель HunyuanWorld-Mirror (Tencent).
На днях ByteDance представила модель Depth Anything 3 (статья)(проект)(код). Depth Anything 3 может предсказывать пространственно-согласованную геометрию по одному или нескольким изображениям, даже без известных параметров камеры. Эта модель обучена на 27 датасетах и демонстрирует state-of-the-art показатели качества, можете сами попробовать - ссылка на демо
Модель имеет трансформерную архитектуру с набором специализированных голов для генерации карт глубин, ray map, поз камеры. Одна модель решает целый спектр задач: от монокулярной оценки глубины и определения поз камеры до прямой генерации 3D гауссианов для синтеза новых ракурсов.
Отмечу разнообразие предобученных версий моделей, например, DA3-Small имеет 30 миллионов параметров и работает почти в пять раз быстрее чем популярная модель VGGT.
#References
Post #263
357


