Robostral Navigate: модель для автономной навигации роботов с помощью одной RGB-камеры
Французский стартап в области искусственного интеллекта Mistral AI представил Robostral Navigate - первую модель компании для автономной навигации роботов. Система принимает на вход изображение с монокулярной RGB-камеры и инструкцию на естественном языке, после чего обеспечивает перемещение робота в заданную точку пространства.
В основе функционирования Robostral Navigate лежит визуально-языковая модель с 8 миллиардами параметров, разработанная внутри компании. Навигация реализована через механизм указания (pointing). Модель не вычисляет траекторию в абсолютных величинах, а определяет на текущем изображении координаты целевой точки и задаёт желаемую ориентацию робота в момент прибытия. Такой подход, оперирующий в визуальном пространстве, обеспечивает устойчивость системы к изменению параметров камеры и масштаба сцены. Если целевая точка не попадает в поле зрения камеры, то модель переключается на команды смещения и поворота в локальной системе координат робота.
Архитектура Robostral Navigate разделяет семантическое планирование и низкоуровневое управление. Первый уровень — визуально-языковая модель с 8 млрд параметров, которая отвечает за понимание инструкции, анализ сцены и выбор промежуточных целей. Она работает с частотой около 2 Гц, предсказывая целевую точку в координатах текущего кадра или, при её отсутствии, выдавая команды смещения в локальной системе координат робота.
Второй уровень — диффузионная модель со 121 млн параметров и контроллер. Модель преобразует выбранную VLM цель в конкретную траекторию, генерируя последовательность из 30 команд на ближайшую секунду с частотой 10 Гц. Эти команды задают относительные смещения, например, «проехать 0,5 метра вперёд и повернуть на 5 градусов». Контроллер, адаптированный под конкретную платформу, транслирует траекторию в высокочастотные сигналы для моторов (100 Гц). Такое разделение позволяет использовать одну и ту же модель на разных типах роботов — достаточно заменить только контроллер.
Обучение Robostral Navigate проводилось в симуляции. Для этого Mistral подготовила около 2.4 миллиона траекторий в 350 тысячах виртуальных сцен, включающих офисные, жилые и коммерческие помещения, многоэтажные маршруты и открытые пространства.
С целью достижения универсальности в процессе генерации данных варьировались размеры робота, высота и наклон камеры, уровень освещения, архитектура помещений и плотность объектов. В итоге модель работает на колесных, шагающих и даже летающих роботах без перенастройки.
После первичного обучения модель была доработана с использованием алгоритма обучения с подкреплением CISPO. Для этого была сформирована выборка из 35 тыс. сложных заданий, на которых исходная версия демонстрировала систематические ошибки.
В тесте R2R-CE итоговая версия модели успешно завершила 77,4% маршрутов в неизвестных сценах, что превосходит предыдущий лучший результат для систем с одной камерой (66,9%) и для систем с несколькими камерами или датчиком глубины (72,1%). В более сложном тесте RxR-CE показатель составил 75,1% против 73,4% у лучшей однокамерной системы. В знакомых сценах успешность возрастает до 79,4%.
Полная версия научной статьи доступна на arXiv.
Наш канал в Мах
Post #976
820

- 👍 3
- 🔥 2
- ❤ 1