TGViewer
Channel Public Channel
Pixel Science

Pixel Science

@pixels_science

пишем о ресёрчах по Комьютерной Графике, нейронному Рендеру и ИИ

и про их влияния на индустрию конечно же, с инсайдами из личного ресёрча и карьеры

автор: @Mishok43, mishok43.com, PhD студент в IVD KIT, ex Eagle Dynamics
Subscribers
478
Photos
136
Videos
53
Links
106

Showing posts older than #91 · Back to latest

Older Posts 12 shown
Post #87 241
Synthesia опять удивляют своими разработками. Они обучили ИИ, генерирующего персональные аватары всего лишь на основе фоток с телефона\вебки юзеров

Аватары очень хороши в эмоции, умеют махать руками, активно двигаться, а также разговаривают на 30 языках.

Также обещают:
- автоматическую генерацию видео по контенту сайта\документа. к примеру для FAQ. сработает ли для лекциями 🤔🤔🤔

- умный захват экрана, который фокусируется на важном контенте. полезно для стримеров\ютуберов

- автоматический перевод видео с его контентом. я не понял можно ли будет воспользоваться их сервисов для любого видео. было бы слаавно

у компании есть шанс феноменально демократизировать доступ к информации для зрителей. и что ещё важнее, это дает возможность блогерам, инфлуенсерам и преподам выйти на любую аудиторию, забыв про языковые барьеры и снизив косты на продакшен.

горжусь тем, что знаю одно из фаундеров лично и ребята демонстрируют крутейшую коллаборацию науки с бизнесом. не часто встретишь успешные немецкие стартапы
Post #83 251
Неплохой пример, сделанный на коленках, как можно из text->video получить 3Д сцену через гауссианы, а после походить в ней в ARе

by LumaLabs

теперь осталось их сделать PBRными и заживём 👌
  • 👾 5
  • 🤯 3
Post #82 294
Pixel Science Началось HPG 2024 Student Real-Time Competition, где за лучшие шейдера обычно раздают бесплатно видеокарты/денежки (до $1к) и прочие плюшки! Возможно будут очки VR Quest 3 в этом году, раз главным спонсором является Meta 😊 прикольная строчка в резюме, а закодить…
https://fixupx.com/HPG_Conf/status/1807818683324289469

объявлены призы в виде Meta Quest 3 и RTX 4080 за лучшие шейдера. победитель выбирает, что ему больше понравится!

напоминаю что 19го июля дедлайн
FxTwitter / FixupX High-Perf Graphics (@HPG_Conf) 📢Thrilled to announce that the #HPG2024 student competition will have two incredible prizes up for grabs! 🎁A Meta Quest 3 and 🎁an NVIDIA GeForce 4080, first-place winner gets their choice! Don’t miss out – check the rules and submit your entries now! htt…
  • ❤ 2
  • 🔥 2
Post #81 232
Pixel Science Как вам рендеры? И это без ИИ, а чисто классический объёмный рендер на основе Radiative Transfer Equation с базовым предположением uncorrelated media (т.е. transmittance описывается экспонентой). Но без скатерринга в первом Figure Идея в том, что вместо гридов…
Это тот самый момент, когда я рад видеть статью, разрешившую часть задач, которыми я сейчас занимаюсь 😁. Просто в связи с тем, что раз таааакие крутые авторы бросились копать в это направление, значит и я не дурак, что потратил последние недели на то чтобы разобраться с Larsen’s Generalized Boltzmann Equation. Larsens GBE - это генеральный случай Radiative Transfer Equation, т.к. последний вводит ряд предположений, которые отрицательно влияют на качество итоговых рендеров как раз таки в представленных выше кейсах)
Для интересующихся полезные ссылки на эту тему:
1 2 3
Post #78 274
Как вам рендеры? И это без ИИ, а чисто классический объёмный рендер на основе Radiative Transfer Equation с базовым предположением uncorrelated media (т.е. transmittance описывается экспонентой). Но без скатерринга в первом Figure

Идея в том, что вместо гридов для хранения density и emissive значений объёмов ребята из Meta взяли за основу 3D Гаусcианы. Не путать с Gaussian Splats

Авторы вывели unbiased transmittance estimator, который основан на аналитических вычислениях. В итоге мы получаем меньшую дисперсию при меньшем числе обращений к памяти, т.к. гауссианы описывают среды эффективнее вокселей.
550.4MBs dense grid -> 215 KBs Gaussians 🔥🔥🔥


Понятно, что хотелось бы сравнения со sparse структурами, но у них свои проблемы в случаи обратного рендера.

Mitsuba 3, ищут пересечения с помощью BVH и RTX, где они апроксимируют гауссианы с помощью треугольников.

Достигают 550 FPS с ограничением максимальной глубины лучей. Железо не указано.

(Статья очевидна подалась на Sigg Asia 24 так что пока сыра)
  • 🤯 2
  • 👍 1
  • 🔥 1
Post #77 281
Pixel Science https://fixupx.com/i/status/1803181568451641487 хреновое качество с CVPR но OpenAI заявляют что в SORA виртуальный персонаж остается консистентным не только при движение камеры вокруг него, как будто бы это игра от 3го лица, но и в разных сценах. всё больше…
ещё один интересный пример, демонстрирующий что text->video может исполнять роль ограниченного (возможно лишь пока...) 3Д движка, на основе китайской модели Kling

проекция и геометрия конечно жёстко выдают ИИ, о чем я писал ранее
Post #74 249
Аномальные тени и геометрия с некорректной проекцией выдают современные генеративные модели.

Авторы обнаружили, что можно просто обучить детекторы ИИ определять оригинальность изображений исключительно полагаясь на геометрические данные без доступа к оригинальным значениям пикселей.

Проверили: Stable DIffusion XL, PixArt-α, OpenAI’s Dalle3, Adobe’s Firefly - стабильно и эффективно палится >50-60% изображений для indoor сцен при низком False Positive Rate. Для outdoor результаты на 10-20% похуже.
Для DeepFloyd не смогли проверить гипотезу из-за проблем с генерализацией, насколько я понял.


Вывод: пока даже text->image, не говоря про text->video, не может стабильно в корректные тени и геометрию. Это конечно не значит, что следующее поколение ИИ не станет лучше. Но статья звучит как прекрасный новый бенчмарк для будущих моделек.

P.s. c тенями не так критично, как с геометрией. важная деталь, имхо.
  • 👍 3
  • 🔥 1
  • 🤯 1
Post #73 504
Простой, понятный и прекрасный доклад о новой фиче под названием GPU Work Graphs, позволяющей наконец таки эффективно исполнять множество пассов в генеральном случаи, где объем и тип работы зависит от предыдущих вычислений

Показали как сократили использование памяти для Software Rasterization на 2 порядка по сравнению с ExecuteIndirect

Эх где они были пару лет назад, когда мой пафф трейсинг пасс генерил неравномерную работу для компьют шейдера, исполняющего ИИ 🥹
  • 👍 7
  • 🔥 1
  • 🤯 1
Post #72 236
https://fixupx.com/i/status/1803181568451641487

хреновое качество с CVPR но OpenAI заявляют что в SORA виртуальный персонаж остается консистентным не только при движение камеры вокруг него, как будто бы это игра от 3го лица, но и в разных сценах. всё больше и больше признаков полноценного 3Д движка
FxTwitter / FixupX SkalskiP @CVPR2024 🇺🇸 (@skalskip92) capabilities 1: characters stay consistent across different scenes
  • 🤔 3
  • 👍 1
  • 👀 1
Post #69 271
Image Neural Field Diffusion Models, диффузка генерирует латентное представление, которые определяет плавное, а не дискретное, изображение

Алгоритм можно использовать для генерации картинок высокого разрешения, при всем при этом контент остается довольно когерентным между различными разрешениями!

Основа: Stable Diffusion

(рекомендую зайти на сайт, а так же оценить Appendix самой статьи, чтобы посмотреть изображения в оригинале)
Post #68 323
Кажется в особенности данный пример демонстрирует возможности text->video Dream Machine генерировать кадры, которые мы бы ожидали от супер реалистичного игрового рендера какого-то шутера.

Пока не понятно, что значит 120 second per 120 frames, на каком железе и т.д. но всего месяц назад я предполагал что генеративки являются угрозой лишь для рынка оффлайн рендера, но сейчас допускаю конкуренцию в будущем и на рынке реал тайм решений.

но вопрос контроля за тем, что происходит в сцене и как оно должно быть визуализировано. и конечно нам также нужны физические представления объектов. чтобы трекать коллизии пуль, как пример

но очень интересно.... надо думать как это все "соединить" 🤔🤔🤔
  • 😁 1
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →