TGViewer
Pixel Science Pixel Science @pixels_science · 480 subscribers
Post #106 323
Обожаю такой формат презентации статьи, где достаточно потребить информацию с сайта и всё станет понятно


Авторы обнаружили, что за camera-to-world projection матрицу, в некой степени, отвечает часть эмбеддинг спейса текстового промпт-а в text-2-image диффузных моделях

Ребята обучали небольшую нейронку предсказывать этот вектор, в зависимости от подаваемой матрицы, и генерировать novel views диффузкой с нужного нам ракурса

Работает не всегда идеально, можно пронаблюдать что структура сцены с разных углов немного, но всё же меняется. Но бьёт оригинальный нёрф в сухую и все SOTA nerf решения по LPIPS (персепшен метрика)

Главный философский вывод, так же подтверждаемый в некой степени иными работами: внутри диффузок наверняка есть "консистентное" 3Д представление сцены и мы наверняка сможем научиться его качественно визуализировать\"взаимодействовать" с ним
Т.е. сделать рендер-физ-движок 😁
  • 🤩 5
  • 🔥 2
  • 👍 1
More from @pixels_science
  1. Aug 25, 2025The Bitter Lesson for RL: Verification as the key to Reasoning LLMs - отличная презентация…
  2. Aug 21, 2025Подытожу этот сумбурный тред фразой одного умного парня из мира Computer Vision: "Не беспо…
  3. Aug 21, 2025Продолжение про SIGGRAPH ч.2 И я сам очень многому удивился и обнаружил свой предсказатель…
  4. Aug 21, 2025Продолжение про SIGGRAPH ч.1 Кто-то просто делает ставки. На 10ки $млн. Надеясь открыть но…
  5. Aug 21, 2025Про SIGGRAPH, рынок, разговоры о будущем графики Съездил. Встретился с 10ками прекраснейши…
  6. Aug 4, 2025Пригласили на SIGGRAPH 2025 ещё раз презентовать нашу статью по нейронному рендеру! Если в…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →