TGViewer
Channel Public Channel
Pixel Science

Pixel Science

@pixels_science

пишем о ресёрчах по Комьютерной Графике, нейронному Рендеру и ИИ

и про их влияния на индустрию конечно же, с инсайдами из личного ресёрча и карьеры

автор: @Mishok43, mishok43.com, PhD студент в IVD KIT, ex Eagle Dynamics
Subscribers
478
Photos
136
Videos
53
Links
106

Showing posts older than #183 · Back to latest

Older Posts 13 shown
Post #180 401
AutoVFX. Заливаешь видео, дополняешь описанием желаемого эффекта и получаешь сцену + рендеры с итоговым результатом

Уже сложно уже даже называть это просто научными статьями, но в общем ребята представили решение объединяющее всё вокруг:
1️⃣ обратный нейронный-гауссиан рендер
2️⃣ AI semantics understanding
3️⃣ LLM prompt->blender code
4️⃣ PBR рендер с анимацией и физ. симуляциями

Хоть этот мутант и выглядит забавно, но я считаю, что примерно в таком направлении комбинации множества технологий и будет происходить индустриальное развитие.

Но всё еще есть вопрос:
Насколько изменения сцены должны быть предсказаны LLMкой или же диффузной моделью через обратный рендер? Первое предполагает "an exposed universal scene description", а второе требует градиентов, но зато бенефитет от SoRA-like моделей, обученных на огромных датасетах с натуральными визуальными эффектами. В тоже время для качественной реализации 1го алгоритма огромных датасетов в мире нет, и не будет наверняка. Но как-то да и работает)

#ии #статья
  • 🔥 3
  • ❤ 1
Post #179 523
Тот самый контролируемый text-> 3D Skeleton animated mesh ->Video\Render уже на подходе

Стартап, MeshCapade, из соседнего ко мне уютного городка Тюбинген продемонстрировал еще один прекрасный пример симбиоза старых и новых технологий

Фаундеры кстати все из Max Planck Institute for Intelligent Systems, в том числе директор этого супер успешного института (я бы сказал главного по ИИ в Германии) - Michael Black. Он также будет одним из Keynote Speakers на Eurographics 2025 в Лондоне, так что кто думает ехать или не ехать -> возможно это стоит вашего времени :)
Post #178 384
После того как все, кто только мог, процитировали твитт Тима, СЕО Epic Games, о том что ИИ - хрень, в контексте майнкрафта, как всегда приятно наблюдать качественную беседу без эмоций в реальном экспертном пузыре твиттера (Thomas Willberger - выпускник моей лабы, сделавший Enscape)

Полностью согласен с уже сдержанной оценкой Тима о разумностей последовательной интеграцией ИИ в современный рендер-пайплайн и очевидных рисках
  • ❤ 7
  • 👍 2
Post #176 367
Предпосылка к темпорально-консистентной "world-model" с 90 FPS на 1ой A100

Работа предлагает end-to-end рендер:
1️⃣ Таргет-лучи кодируются как токены
2️⃣ В случаи encoder-decoder кодируется латентное представление сцены и последовательно обновляется на основе токенов подаваемых опорных изображений

В случаи decoder-only просто предсказываем исходя из токенов изображений. не скалируемо и не интересно

3️⃣ Autoregressive модель, как LLMка, предсказывает рендер на основе серии вышеописанных токенов

Всё прекрасно, авторы побили алгоритмы с идеями из классического 3Д. какбы отсылая к "The Bitter Lesson"...

Но я вижу это немного иначе: encoder-decoder существенно проигрывает decoder-only (на уровне гауссиан) из-за компрессии всей сцены в 1 латентный-вектор и потери деталей

но можно же сделать его в 2х длиннее? да, но косты трансформеров O(N^2) рейтрейсинг - O(logN)-O(N)

и хз насколько window\stochastic\X-attentions достигающие ~O(N) подойдут. моя гипотеза, что не особо по ряду причин. но.. будем проверять 😊
  • 🔥 3
Post #175 379
Pixel Science "Реал-Тайм" Майнкрафт в браузере зарендеренный полностью диффузной моделью на специальном железе Sohu, заточенном исключительно на матричные операции Да да, можно поиграть прямо сейчас Это коллаб Etched (Sohu) и нового израильского стартапа Decart, который…
Пример реальной "памяти" диффузной модели в диффузном Minecraft-е

Тоже самое вы можете пронаблюдать, если несколько раз нырнете в воду и тут же из неё выплывете - каждый раз окружение будет совершенно разное

Поэтому, как я и писал в посте про Doom, я верую что текущие "игровые"-диффузные модели = тупо DLSS с экстраполяцией кадров на максималках, conditioned on user input. Для решения фундаментальной проблемы надо вводить блоки памяти\game state. Возможно для этого им надо реализовывать подобие Long short-term memory (LSTM) но там afaik проблемы с обучением (не обучал их с домашек по универу). Или обучаемая MLP-память, но тут лучше скажут ИИ-ученые

Или же идти через призму классического 3д рендер пайплайна, с введением понятия "сцены". Но таким образом наследуются все, или почти все, проблемы классического дифференциального рендера и light transport simulation (простой пример: зеркала)

незадача 😔

#ии
  • 👍 5
Post #174
Channel name was changed to «Pixel Science»
Post #173 361
"Реал-Тайм" Майнкрафт в браузере зарендеренный полностью диффузной моделью на специальном железе Sohu, заточенном исключительно на матричные операции

Да да, можно поиграть прямо сейчас

Это коллаб Etched (Sohu) и нового израильского стартапа Decart, который уже стал прибыльным. Ребята разработали свой закрытый фреймворк для обучения и исполнение диффузок, с максимально оптимизированными ядрами и коммуникацией между GPUшками. Пишут про 47ms и 156ms для 1-итерации исполнения и соответственно обучения диффузной модели. И его продают тем, кто использует кластеры c более чем 1000ми H100

Также утверждают, что на H100 их Майнкрафт-моделька исполняется в 360p в 20 фпс, а на Sohu разрешение вырастает до 4к + энергоэффективность в 10х выше. звучит ооочень сладко для будущего клауд-ИИ-гейминга\кино

Фундаментально ничего нового, т.к. игровые-диффузки изобрели не сегодня (писал тут про Doom от Google), но доступ к ним прямо через браузер + очень амбициозные числа конечно удивляют!

#ии #индустрия
  • 🔥 3
Post #171 359
Autodesk заэквайрила Wonder Dynamics, предлагающий AI, но в рамках классического 3Д пайплайна

Их server-based решения позволяют вытянуть анимацию из видео, наложив её на нужную модельку со скелетной\лицевой анимацией с сохранением динамики камеры, освещения и пост-эффектов. В итоге, артисты могут все подредактировать в Autodesk\UE\Blender, как и делали ранее 😊 т.е. сохранение артистик контроля что безумно важно для индустрии

Инструмент предлагает как и анимирование уже существующей 3Д сцены на основе видео, так и реалистичную вставку в уже существующие видео (кино) 3д моделей

Сумма сделки, к сожалению, не разглашается... Из интересного: кофаундером является Tye Sheridan (главный актер "Первому игроку приготовиться"), а в адвейзер-боард входит аж Стивен Спилберг!

постучался к некоторым ребятам на линкедине 😊

#индустрия #графон #ии
  • 👍 7
  • 🔥 5
  • ⚡ 1
Post #170 331
Бесит шум в рендере? просто минимизируйте его! - именно c такой идеей выпустили статью исследователи из Weta FX (Аватар, Планета Обезьян), выведя unbiased variance gradient estimator of Monte Carlo Light Transport estimator... ну вы поняли в общем (надеюсь)

По делу: unidirectional path-tracer (т.е. "обычный"), Dr. Jit для генерации auto-diff кода на GPU, RTX 4090

Авторы провели эксперименты, где попытались оптимизировать дисперсию (читай шум) сцен, корректируя градиентным спуском параметры как сцены, так и алгоритма трассировки лучей (к примеру Russian Roulette probability). Заняло 0.25-10 минут в их случаи, но делается это всё заранее 1 раз

Далее все рендерится тем же алгоритмом, который использовался и до оптимизации но уже с меньшим шумом, но порой с небольшим bias-ом. Такой variance-bias tradeoff. Cоответственно звучит как очень интересная идея для gamedev индустрии: нам часто важнее получить стабильный предсказуемый уровень шума, нежели чем unbiasedness и 100% качество освещения

#графон #статья
  • 👍 7
Post #168 441
3Д Диффузки для генерации 3Д сцен с гауссианами

Ребята из TUM показали свою новую работу, примечательную тем, что диффузная сеть работает в трехмерном латентном пространстве, из которого далее декодируются гауссианы через vector-quantized variational autoencoder (VQ-VAE). Формально можно сделать тоже самое и с треугольниками с pbr материалами

Учитывая возросшие косты на разработку игр, имхо работа очень актуальна!

Но вопрос скалируемости + костов на исполнение. 3Д конволюции это довольно дорогое удовольствие по моему опыту и быстро упирается в VRAM Bandwidth

#графон #ии #статья
  • 👍 5
Post #166 433
Обратный "рендер" движок но для 3Д томографии и оптимизации ДВС для эффективной теплопроводности

Вензел Якоб со своими студентами как всегда в очередной раз повышает планку серьезности исследований в Computer Graphics и выкатывает просто бомбу, а не статью. Я конечно был в курсе что они занимаются применением идей и фреймворков Dr.Jit (основа Mitsuba 3, эффективный auto-diff для CPU\GPU) из сферы обратного рендера для серьезных обратных задач физики, но не мог себе представить что они всего за пару лет дойдут до такого

Ведь всё началось с сильной магистерской работы Ekrem Fatih Yilmazer, которую ребята выложили на архив еще в далеком 22ом году

Всем интересующимся советую почитать статью, а тем кто хотел бы позаниматься чем-то похожим и сейчас учится в вузе, я напоминаю что в их лабе проходит Summer Research School с дедлайном подачи 1го декабря. Виза, перелеты, проживание (1800 франков в месяц) - все оплачивается

0 ИИ

#графон #статья
  • 🔥 7
  • 👍 1
Post #165 351
Довольно интересная история происходит в индустрии генерации видео, напоминающая мир тулзов для 3Д

KREA AI добавила поддержку под своим капотом основных топовых моделей для генерации картинок и видео (Runway, Luma Labs, Kling, Pika и т.д.), тем самым избавляет последних от нужны кодить соответствующие тулзы

Очень напоминает историю 3д редакторов с поддержкой множества разных рендер-движков. Вопрос лишь один: Adobe же может сделать абсолютно также c Photoshop и Premiere Pro и зачем нужны будут какие-то иные тулзы типа KREA?

Так или иначе всё чётче и чётче вырисовывается рыночная цепочка нового ИИ-рынка, что я считаю положительной новостью

#индустрия #ии

P.s. я последние недели в активном ресерче из-за возможного breakthrough... так что соррян за временно меньший поток интересной дичи
  • 🆒 4
  • 🤔 1
Post #161 576
Дайджест за неделю 30.09

продолжаем экспериментировать с таким форматом!

Графон:
- Faster Ray Tracing through Hierarchy Cut Code вводит идею сортировки лучей для обхода BVH через этот же самый BVH 😁. Идея проста, но прирост в 1.81х раза
- Более точные Real-Time Anisotropic Specular Reflections на основе Image-Based Lighting
- АМД представила unbiased семплирование конволюции между Spherical Gaussians, описывающие BRDF и Light Sources, для давления шумов от прямого освещения

ИИ:
- ETH+Disney поправили кислотные цвета от Classifier-free Guidance в диффузках

Индустрия:
- Luma Labs ускорила генерацию видео в 10х до 20 секунд для 5 секундного результата, без потери качества. Призывают к ним идти, если шарите за CUDA
- RunWay ML планируют делать фильмы и ищут сценаристов, продюсеров и т.д.
- Создатель NeRFов вместе с "god mother of AI" анонсировали стартап c 230$ млн
- Chaos добавил поддержку Gaussian Splatting в V-Ray 7 Beta

Риск частичного вытеснения оффлайн-рендер движков в мире кино повышается

#дайджест
  • 👍 4
  • 👏 1
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →