Scaling Cross-Embodied Learning: One Policy for Manipulation, Navigation, Locomotion and Aviation
yo, Беркли сделали один трансформер, который может принимать в себя разные инпуты по роботике (включая текст, картинки разной природы и разную проприоцепцию) и управлять разными устройствами (даже внутри одной задачи)
окей, а поконкретнее - совершенно разные входные пространства, пространства действий, а это все еще приправлено тем, что надо осуществлять предикт с разной частотой (от 5 до 20 Гц). и все это неплохо было бы захендлить более-менее единой архитектурой. а задачки включают в себя:
- того самого четвероного
- однорукого манипулятора
- двурукого манипулятора
- машинки с колесиками врум врум с проблемой навигации
суммарно вышло 20 различных вариантов робота
и как показывают эксперименты, такой претрен на разных роботиках позволяет улучшить результаты друг друга, ибо близко к понятию фаундейшн моделей, да и просто с разных датасетов данных больше, на которых чему-то можно научиться + влияет гетерогенные инпуты имхо (где-то нужен текстовый промпт, где-то этого вообще не надо и достаточно картинки обсервейшна в данный момент времени + целевого обсервейшна)
при том достигается это даже при столь сильно несбалансированном датасете, хотя и здесь не обошлось без проблем при наложении весов на разные таски + авторы говорят, что есть серьезная проблема в скейле - если делать модель больше, то перформанс ухудшается на тасках с высокочастотными роботами
ах да, и это все на джаксе :)
👀LINK
Post #494
552




- ❤ 2
- 🔥 2