Google DeepMind представили Gemini Robotics 2
С релиза версии 1.5 прошел почти год. Довольно долгий перерыв по сегодняшим меркам. Посмотрим, чего Google добились за это время.
Самое важное: VLA-модель, которая лежит в основе, впервые управляет полным телом гуманоида от стоп до пальцев рук, а не только верхней частью корпуса. При этом у рук моторика достаточно мелкая, 22 степени свободы. Нельзя сказать, что робот получается супер-ловким (success rate на multi-finger задачах в районе 30-40%), но это прогресс.
Поверх VLA-модели также работает оркестратор Gemini Robotics ER 2. Это отдельная модель поколения, и тут уже просто VLM. То есть, если у VLA на выходе готовые моторные команды, то ER – это более высокий уровень, но котором выполняется ризонинг, разбиение задачи на подзадачи, распознавание объектов и их координат и прочая "интеллектуальная" работа.
Эту модель тоже существенно прокачали и добавили ей киллер-фичу в виде способности координировать работу сразу нескольких разнотипных роботов для выполнения одной задачи. Кроме того, теперь ER может вмешиваться в действия VLA на любом этапе выполнения задачи, что критично для self-correction.
Еще в поколении появилась модель Gemini Robotics On-Device 2 – облегченная VLA для локального инференса.
Основное отличие Gemini Robotics – универсальность. Модели обучают на гетерогенных мультиэмбодимент-данных, поэтому они могут работать на роботах самых разных типов без тюнинга. Так вот GR2 On-Device выводит это свойство на практический уровень: вы можете взять эту модель и буквально за несколько часов и ~200 демонстраций заставить ее хорошо работать на любом новом теле (с кастомными сенсорами, DoF, кинематикой и тд).
https://deepmind.google/blog/gemini-robotics-2-brings-whole-body-intelligence-to-robots/
А еще из забавного: Google сделали первый бенчмарк для оценки безопасности роботов и назвали его ASIMOV-Agentic. Свою модель они, естественно, заявили как "самую безопасную в мире" по этому тесту ☕️
Post #9643
26.4K