Qwen-Robot Suite — набор из 3 моделей для воплощённого интеллекта, который нацелен заполнить пробел между пониманием визуально-языковых моделей и физическим действием.
Модели RobotNav, RobotManip и RobotWorld отвечают соответственно за навигацию, манипуляцию и моделирование физического мира.
🟡Qwen-RobotNav
Построена на Qwen3-VL и объединяет в одной модели 5 навигационных задач: следование инструкциям, поиск объекта, слежение за целью, автономное вождение и ответы на вопросы о среде.
Поведение задаётся через протокол наблюдения с 4 параметрами - бюджет визуальных токенов, временное затухание, веса камер и режим выборки кадров.
Qwen заявляет о рекордных результатах в 5 областях и о работе без дообучения на четвероногом Unitree Go2.
🟡Qwen-RobotManip
Опирается на Qwen3.5-4B VL и модуль формирования действий на базе flow-matching DiT. Она использует единое 80-мерное представление состояния и действия для разных типов роботов.
Разработчики сообщают о точности 91,4% в тесте LIBERO-Plus и о 1 месте в одном из треков конкурса RoboChallenge.
🟡Qwen-RobotWorld
Модель мира. По текущему наблюдению и текстовой команде она предсказывает, как изменится сцена. Все действия описываются естественным языком, что позволяет объединить в одной системе более 20 типов роботов и свыше 500 категорий действий.
В основе лежит 60-слойная архитектура MMDiT, связанная с представлениями Qwen2.5-VL.
Qwen рапортует о первых местах в тестах на соответствие физическим законам (EWMBench, WorldModelBench и других), в части из них - среди открытых моделей.
🟡Отдельно анонсирована функция Chat2Robot
Это браузерное демо управления текстовыми командами и наблюдением за реакцией робота в реальном времени.
Сейчас оно работает только с упрощённой версией модели RobotManip, которая была обучена на наборе из 50 задач. Её цель - показать частичную способность выполнять незнакомые инструкции.
В анонсе не указано, будут ли открыты ли веса и под какой лицензией. Пока доступны технические отчёты и анонсы по каждой модели.
@ai_machinelearning_big_data
#news #ai #ml
