Google DeepMind представила Gemini Robotics 2 — семейство моделей для управления роботами.
Google DeepMind представила новое поколение моделей для управления роботами - Gemini Robotics 2, которое позиционируется как универсальная интеллектуальная система, которую можно адаптировать под различные робототехнические платформы — от двуруких манипуляторов до человекоподобных роботов.
Семейство объединяет три специализированные модели, отвечающие за непосредственное управление роботом, высокоуровневое рассуждение и локальную работу на самом устройстве:
• Gemini Robotics 2 — основная VLA-модель, преобразующая визуальную информацию и текстовые инструкции в управляющие команды для робота. В новой версии система получила возможность координировать работу всего тела гуманоидного робота. Модель была испытана на платформах Apptronik Apollo 2 и Franka Duo. На Apollo 2 она координировала перемещение робота для выполнения задач, требующих одновременной ходьбы, наклонов и выполнения различного рода манипуляций. Модель также получила более развитые навыки работы с антропоморфными пятипалыми кистями (до 22 степеней свободы), включая завязывание узлов и закрытие зип-пакетов.
• Gemini Robotics ER 2 — модель воплощённого рассуждения (embodied reasoning), выполняющая функции высокоуровневого «мозга». Она анализирует пространственную среду через непрерывный видеопоток, разбивает сложные задачи на последовательность действий и отслеживает их выполнение. ER 2 не управляет приводами напрямую, а передаёт подзадачи VLA-модели. Это позволяет выполнять многошаговые сценарии длительностью в несколько минут и восстанавливаться после ошибок. Модель также поддерживает координацию работы группы роботов для совместного выполнения задач.
• Gemini Robotics On-Device 2 — локальная VLA-модель для автономной работы робота без постоянного подключения к облаку. Локальное выполнение минимизирует задержки и зависимость от сети, при этом модель способна адаптироваться к работе на новых типах манипуляторов за несколько часов с использованием менее 200 демонстрационных примеров. Работу системы уже протестировали на платформах Dexmate, SO101 и Trossen.
Демонстрации показывают прогресс в повышении ловкости устройств, работающих на новой версии модели. При этом разработчики признают, что показатели успешности и скорость выполнения операций пока сильно зависят от сложности задачи и требуют дальнейшей оптимизации. Так, согласно официальным данным Google DeepMind, успешность выполнения задач варьируется от 32% (сборка с совком) до 92% (выкручивание лампочки).
Gemini Robotics ER 2 уже доступна разработчикам через Google AI Studio и Gemini API. Исполнительные VLA-модели (Robotics 2 и On-Device 2) пока предоставляются ограниченному кругу партнёров, среди которых Apptronik, Boston Dynamics и Agile Robots.
Источник: Google Deepmind
Post #980
626