TGViewer
Neurohive Neurohive @neurohive · 5.16K subscribers
Post #1969 3.78K
4DAnyone: 4D-модель человека из видео, снятого одной камерой

Исследователи из Zhejiang University, Robbyant, Ant Group и HKUST представили 4DAnyone - открытый фреймворк, который строит 4D-модель человека на основе видео, снятого с одной камеры. 4DAnyone генерирует 16 согласованных между собой ракурсов, а по ним уже собирается объёмная сцена в формате 4D Gaussian Splatting. Раньше для такого требовалась студия с десятками синхронных камер. Готовую модель человека можно смотреть с любой точки в VR-шлеме, вставлять в игру или AR-сцену, использовать как данные для обучения роботов движению. Наилучшие результаты достигаются при одном человеке в кадре, спокойном движении камеры и облегающей одежде.

3D-модель - это объект, который можно осмотреть со всех сторон, но застывший в одной позе. 4D-модель добавляет четвёртую ось - время. Cцена меняется от кадра к кадру, объект двигается, и при этом на каждый момент времени существует его полное объёмное представление.

В основе фреймворка лежит видеодиффузионный трансформер Wan2.2-TI2V-5B, который дообучили генерировать новые ракурсы человека по 3D-скелету, сохраняя внешность из исходного видео. В скелете оставили 40 ключевых точек: 17 на теле, 6 на стопах, 10 на уровне ладоней и 7 вспомогательных. Детальную разметку лица и суставов пальцев отбросили: такие точки определяются неточно, и метод, следуя за ошибочным положением, выдаёт артефакты. Мимику и форму кистей он вместо этого берёт из исходного видео.

По качеству реконструкции 4DAnyone обходит все сравниваемые методы: 24.15 PSNR против 20.55 у ближайшего конкурента на DNA-Rendering и 23.28 против 19.86 на DyMVHumans.

Проект открытый: код опубликован на GitHub, веса - на Hugging Face.

#Stateoftheart
  • 🔥 9
  • ❤ 8
  • 👍 5
More from @neurohive
  1. Sep 24, 2026RRSI: метод рекурсивного самоулучшения обвязки ИИ-агентов от Google улучшил результаты Cla…
  2. Sep 19, 2026Vidu S2: модель генерирует видео-аватары и редактирует стримы на лету в 720p при 25–42 FPS…
  3. Sep 9, 2026WorldSculpt: модель собирает 3D-сцену с сотнями отдельных объектов из видео Alaya Lab и То…
  4. Aug 31, 2026🗣 VoiceMem: фреймворк памяти для голосовых ассистентов поднимает факты из всех прошлых ди…
  5. Aug 11, 2026JoyAI-Video-Edit: 16B-модель редактирует видео в реальном времени при 30 FPS в 720p на одн…
  6. Aug 3, 2026TurboVLA: робот получает команды в разы быстрее при 97% успешных выполнений благодаря заме…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →