Ниже текст Антона Обухова - одного из наших сильных студентов прошлых лет, который после университета попал в NVIDIA, был перевезен в Калифорнию, а потом загрустил от прода и в 32 года поступил в аспирантуру в Цюрихе (и дальше много раз повторял "эх если бы я раньше..."). Хотя он все равно безмерно крут и подавляющее большинство тоскующих от прода даже ШАД не могут затащить (поинтересуйтесь на досуге сколько там поступает и сколько заканчивает).
Ну а Антон сотоварищи недавно выпустили SOTA в depth estimation (мы темой тоже занимались и на ВМК я даже курс "Введение в 3D видео" читал, но сейчас тема на второй план отошла). Причем у них идеи, которые потенциально и к другим областям применимы (Антон докладывался на митапе нашей лаборатории и это обращение к тем, кому зашел его митап):
хотел попиарить нашу новую работу -- мы сделали лучший monocular depth estimation, назвали его Marigold, и вынесли им старичка MIDAS, которым до сих пор пользовались в Гугле и Дисней ресерч. Если кто помнит, год назад я делал ставку на диффузионки и файнтюнинг генеративных моделей (текст-в-картинки) для решения полезных задач, типа регрессии. Это именно то что мы и сделали, и это открывает на самом деле большие возможности. Хотя в нашей работе мы и показываем, как с этим подходом к регрессии решить задачу оценки карты глубины, ничто не мешает применять этот же подход для решения любых других задач. Важно лишь соблюсти ряд условий, которые прописаны в нашей статье, и SOTA (и возможно ещё одна статья на конференции) -- ваша!
🧑🎓 Сайт - оч залипательный!
📖 Статья
🧑🏻💻 Код
🔗 HuggingFace
🔗 Colab