BLARM анимирует статичную 3D-модель по обычному видео без рига и скелета
Девять авторов из Roblox, UMass Amherst и Технического университета Крита выложили на arXiv метод, который берёт статичную сетку и монокулярное видео и возвращает согласованную по времени анимацию. Ни скелета, ни cage, ни весов скиннинга: движение раскладывается на 31 обучаемый жёсткий компонент плюс корневой, с постоянными весами вершин к компонентам.
Скорость для такого класса задач непривычная: 16 кадров на RTX 4080 за 3,13 секунды. ActionMesh на том же тесте тратит 350 секунд, Mesh4D 55,33. По метрикам на ActionBench: CD-3D 1,71, CD-4D 3,07, CD-Motion 7,15. Обучение заняло 1,5 дня на восьми H200.
Ограничения авторы показывают честно: ошибки на соседних визуально похожих участках и при неподходящей топологии сетки, длинные видео обрабатываются авторегрессионно. Кода и весов пока нет, статья под CC BY 4.0. Для техартистов это повод следить за репозиторием: пайплайн «снял на телефон, получил анимацию ассета» перестаёт быть фантастикой. Статья на arXiv.
@make_game
Post #2024
1.2K
- 👍 2
- ❤ 1
- 😇 1