Предпосылка к темпорально-консистентной "world-model" с 90 FPS на 1ой A100
Работа предлагает end-to-end рендер:
1️⃣ Таргет-лучи кодируются как токены
2️⃣ В случаи encoder-decoder кодируется латентное представление сцены и последовательно обновляется на основе токенов подаваемых опорных изображений
В случаи decoder-only просто предсказываем исходя из токенов изображений. не скалируемо и не интересно
3️⃣ Autoregressive модель, как LLMка, предсказывает рендер на основе серии вышеописанных токенов
Всё прекрасно, авторы побили алгоритмы с идеями из классического 3Д. какбы отсылая к "The Bitter Lesson"...
Но я вижу это немного иначе: encoder-decoder существенно проигрывает decoder-only (на уровне гауссиан) из-за компрессии всей сцены в 1 латентный-вектор и потери деталей
но можно же сделать его в 2х длиннее? да, но косты трансформеров O(N^2) рейтрейсинг - O(logN)-O(N)
и хз насколько window\stochastic\X-attentions достигающие ~O(N) подойдут. моя гипотеза, что не особо по ряду причин. но.. будем проверять 😊
Post #176
367

- 🔥 3