Очень интересную статью нашел, по формированию 3D представлений для роботов.
Тут важно понимать, что осознание объекта будет работать чуть ближе к реальности, если сравнивать с обучением по обычным видео. Этот метод чуть ближе к реальному представлению механики объектов.
Получая гаусиан сплат, модель делит объект на составные части и пытается определить, как каждая часть может двигаться в пространстве понимая физическую суть объекта. Если раньше по видео, модели просто выучивали движение пикселей от первого до последнего кадра и повторяли их бездумно, то теперь у них будет понимание близкое к человеческому, когда вы просто посмотрели на объект, но еще не трогали его.
Сплаты, кстати, теперь умеют двигаться в пространстве, логично привязанные к сегменту.
arxiv
Статья
@CGIT_Vines
Post #2970
3.68K