✔️ Qwen выпустила Qwen-RobotManip - базовую vision-language-action модель для управления роботами.
Модель построена на Qwen-VL / Qwen3.5-4B и объединяет визуально-языковую основу с action-модулем на Diffusion Transformer и flow matching. Это позволяет напрямую генерировать непрерывные движения робота, сохраняя понимание изображения и текстовых инструкций.
Главная идея проекта - сначала выровнять данные, потом масштабировать обучение.
Датасеты робототехники сильно различаются: разные роботы, камеры, системы координат, пространства действий и способы сбора данных. Qwen-RobotManip приводит их к общей системе на уровне представлений, движений и поведения.
Для обучения использовали только открытые датасеты роботизированных манипуляций и видео от первого лица - без собственного закрытого сбора данных. В итоге собрали около 38 100 часов данных.
Авторы показывают сильное обобщение на новые условия, выполнение инструкций, восстановление после ошибок и перенос навыков между разными типами роботов.
https://github.com/QwenLM/Qwen-RobotManip
Post #1466
1.5K

- ❤ 3
- 👍 2
- 🔥 1