TGViewer
Neurohive Neurohive @neurohive · 5.16K subscribers
Post #1972 3.07K
WorldSculpt: модель собирает 3D-сцену с сотнями отдельных объектов из видео

Alaya Lab и Токийский университет представили открытую модель, которая строит 3D-копию комнаты или улицы, где каждый предмет остаётся самостоятельным мэшем. Стул можно выделить, отодвинуть, уронить в физическом движке. Существующие подходы либо склеивают сцену в один кусок геометрии, либо оставляют дыры там, где предмет закрыт другим. Код модели опубликован на Github, веса - на HuggingFace.

Из отснятого помещения получается сцена в Blender или Unity, где мебель существует по отдельности: диван можно убрать, стол подвинуть, лампу заменить другой моделью. Для игр так собирают уровни из реальных интерьеров. В AR приложение начинает понимать, что перед ним стол, а не безымянная поверхность. Дизайнеру интерьеров такая сцена даёт готовый набор ассетов вместо цельной болванки. Роботы могут отработать захват кружки в симуляторе, где кружка должна быть отдельным телом с массой и границами, а не выступом на общей стене.

WorldSculpt - это надстройка над Pixal3D. Веса исходного генератора одиночных объектов заморожены, обучены только LoRA-адаптеры и слои, которые позволяют смотреть на предмет сразу с нескольких ракурсов. То, что скрыто на одном кадре, берётся с другого, поэтому модель не выдумывает закрытые части, а собирает их из реальных наблюдений.

Модель должна знать, откуда и под каким углом снят каждый кадр, а ещё получить маски объектов и грубые 3D-боксы. Для этого нужно построить пайплайн: траекторию камеры восстановит COLMAP или VGGT, маски даст SAM3, и только после этих шагов запускается WorldSculpt.

Авторы собрали свой набор тестовых сцен UE-MeshyScene, в самой плотной из них 701 объект. Качество меряют метрикой CD-ℓ2: она показывает, насколько сильно построенная поверхность расходится с настоящей, поэтому чем меньше число, тем точнее результат. У ближайшего конкурента ShapeR средняя ошибка составляет 7.42, у WorldSculpt 2.48. Медианная ошибка по объектам упала сильнее: с 2.47 до 0.25. Раз медиана улучшилась заметнее среднего, выигрыш дают не отдельные удачные предметы, а типичный объект в сцене. Доля правильно восстановленной поверхности (F-Score) выросла с 0.813 до 0.951.

#Stateoftheart #Benchmark
  • 🔥 5
  • ❤ 2
  • 👍 2
  • ❤‍🔥 1
  • 🎉 1
More from @neurohive
  1. Sep 24, 2026RRSI: метод рекурсивного самоулучшения обвязки ИИ-агентов от Google улучшил результаты Cla…
  2. Sep 19, 2026Vidu S2: модель генерирует видео-аватары и редактирует стримы на лету в 720p при 25–42 FPS…
  3. Aug 31, 2026🗣 VoiceMem: фреймворк памяти для голосовых ассистентов поднимает факты из всех прошлых ди…
  4. Aug 24, 20264DAnyone: 4D-модель человека из видео, снятого одной камерой Исследователи из Zhejiang Uni…
  5. Aug 11, 2026JoyAI-Video-Edit: 16B-модель редактирует видео в реальном времени при 30 FPS в 720p на одн…
  6. Aug 3, 2026TurboVLA: робот получает команды в разы быстрее при 97% успешных выполнений благодаря заме…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →