Google DeepMind представила Gemini Robotics 2 — новое поколение моделей для управления физическими роботами.
Главное изменение: раньше нейросеть обычно управляла отдельным манипулятором или выполняла заранее обученную операцию. Теперь одна система может одновременно контролировать руки, ноги, корпус, равновесие и перемещение гуманоидного робота.
Это не одна нейросеть, а связка моделей:
1. Gemini Robotics ER 2 — планировщик
Получает видео с камер, звук и команду человека. Модель:
— находит объекты и их координаты;
— оценивает состояние задачи;
— разбивает цель на шаги;
— выбирает, какого робота и какую функцию вызвать.
Доступны две API-модели:
gemini-robotics-er-2-preview — анализ и планирование;
gemini-robotics-er-2-streaming-preview — постоянный двусторонний канал через WebSocket для управления в реальном времени.
2. Gemini Robotics 2 — VLA-модель
VLA означает Vision-Language-Action. Она переводит изображение и текстовую команду непосредственно в моторное управление: движения рук, ног, корпуса и захватов.
Есть облегчённая Gemini Robotics On-Device 2, рассчитанная на локальный запуск на вычислителе робота. Полные веса моделей публично не выложены; On-Device доступна доверенным тестировщикам.
Как выглядит цикл управления
камера → ER 2 → план → вызов функции робота → выполнение → новый кадр → проверка результата
Например, команда «убери предметы со стола» превращается в последовательность:
navigate("table")
detect_objects()
grasp("bottle")
navigate("recycling_bin")
release()
Разработчик сам описывает доступные функции: navigate, grasp, move, speak. Gemini вызывает их через function calling, ждёт завершения физического действия и получает результат обратно.
Официальная демонстрация Google DeepMind:
https://www.youtube.com/watch?v=4lSQnrMC6nY
Видео: Google DeepMind