VLA: универсальный водитель роботов
Потестировал Visual Action Language model (VLA). По ощущениям - уровень GPT‑2: первые "искры будущего интеллекта", aha‑moment уже витает в воздухе. Кажется, в робототехнике скоро будет тот же рывок, что случился в LLM с появлением ChatGPT.
Как это выглядит
Вы подаете на вход конфигурацию любого робота с его датчиками/камерами/приводами и простую текстовую команду, например:
"Возьми красный кубик Lego и положи его на тарелку".
Дальше модель сама управляет железом и решает задачу. Такой себе универсальный "водитель роботов", который учится по ходу дела и не привязан к конкретной архитектуре.
Мой стенд
Чтобы лучше разобраться в теме, собрал себе набор манипуляторов от Hugging Face 🤗 - LeRobot и попробовал дообучать их SmolVLA.
Что внутри:
- 2 робо‑руки из 3D‑печатных деталей и ходовых сервоприводов (китайцы продают на Али за 20-25к руб)
- Одна–три камеры — можно поставить их как удобно (у меня две usb-вебки)
- Текстовые команды на английском
- Модель смотрит в камеры и пытается выполнить задачу, управляя моторами манипуляторов
- Сама модель крутится на ПК рядом. Нужен GPU или свежий мак
Боли
- Нужен файнтюнинг под конкретный сетап. Без него это больше похоже на конвульсии
- Подвинул камеру - файнтюнь заново
- Нет рефлексии: модель пока не может исправляться на лету, как LLM. Если робот творит дичь, то это будет прогрессировать.
- Чувствительно к окружению. Освещение, цвет стола, фон. Лучше не менять в процессе работы.
- Реалтайм требует маленьких моделей. Конкретно у меня — ~0.5B (у серьезных людей 3–7B). Маленькая - быстрая, но справляется только с простыми командами.
Главный инсайт (прямо по Канеману) - роботу нужны две системы управления.
Система 1 - быстрая VLA для реального времени: видеть‑решать‑двигать.
Система 2 - медленная рассуждающая vLLM, которая понимает задачу целиком, раскладывает на шаги, ставит подзадачи системе 1 и рефлексирует промежуточные итоги: "Движемся ли мы к цели? Как починить? Зачем я создан? 😂". Тут отлично подойдет GPT-5 или тот же GigaChat.
Оптимизм
Hugging Face копит пользовательские датасеты от разных сетапов - растет корпус "жизненных" сценариев и видов конфигурации роботов. Не важно какого цвета у вас корпус или как расположены камеры. Если тренд продолжится, получим ту самую модель "универсального водителя": одна и та же софтина решает разные типы задач на разном железе - то, с чем годами бились команды классической робототехники.
Подход на базе гибких универсальных моделей радикально снижает требования к стоимости железа для робота. Не обязательны больше лидары, микронные точности приводов, энкодеры и стерильная рафинированная среда как у промышленных роботов.
Частый вопрос - а достаточно ли одних камер? У человека есть ещё тактильные ощущения. Мой ответ: посмотрите на экскаваторщиков, у них из обратной связи в основном глаза, но при этом опытный оператор может ковшом бутерброд приготовить при желании.
Итог
Я жду в робототехнике того же, что произошло с NLP - внезапно одна технология решила сразу все задачи, которые годами решались разными способами с огромными трудозатратами (все эти скриптовые боты и прочие попытки играть в компьютерные лингвистики).
Post #96
1.57K
- 🔥 9
- 👍 3
- 😱 2