Обожаю такой формат презентации статьи, где достаточно потребить информацию с сайта и всё станет понятно
Авторы обнаружили, что за camera-to-world projection матрицу, в некой степени, отвечает часть эмбеддинг спейса текстового промпт-а в text-2-image диффузных моделях
Ребята обучали небольшую нейронку предсказывать этот вектор, в зависимости от подаваемой матрицы, и генерировать novel views диффузкой с нужного нам ракурса
Работает не всегда идеально, можно пронаблюдать что структура сцены с разных углов немного, но всё же меняется. Но бьёт оригинальный нёрф в сухую и все SOTA nerf решения по LPIPS (персепшен метрика)
Главный философский вывод, так же подтверждаемый в некой степени иными работами: внутри диффузок наверняка есть "консистентное" 3Д представление сцены и мы наверняка сможем научиться его качественно визуализировать\"взаимодействовать" с ним
Т.е. сделать рендер-физ-движок 😁
Post #106
323




- 🤩 5
- 🔥 2
- 👍 1