Промт-инжиниринг выходит в физический мир
Опять про роботов. Несколько дней назад Generalist AI представила GEN-1.5 — новую модель для управления роботами.
Обычно, если мы хотим научить робота новому действию, нужно собрать кучу данных, обучить модель и проверить ее на реальном железе.
GEN-1.5 обучали больше восьми месяцев, пока исследователи не попробовали вообще не обновлять веса.
И оказалось, что модель способна понять новую задачу из контекста.
Теперь роботу можно показать 3–12 секунд физического действия, после чего GEN-1.5 попытается выполнить его сама. Generalist AI называет это физическим промтингом.
Примерно как с языковой моделью, только здесь в промт передается не текст, а сенсорные данные и само действие.
Демонстрация помещается в 30-секундный контекст. Модель смотрит на пример и текущее состояние среды и пытается понять, что нужно сделать.
На десяти коротких задачах такой способ дал около 59% успеха. Конечно, для промышленного робота это пока так себе результат.
Но пять минут данных и десять шагов дообучения поднимают результат примерно до 83%. Один шаг на одной минуте данных дал 66,5%.
Я бы смотрел не столько на проценты, сколько на сам процесс обучения новому навыку.
Раньше под новую задачу могли потребоваться часы данных и полноценное обучение. Теперь сначала можно показать несколько секунд примера. Если этого недостаточно — собрать несколько минут данных и дообучить модель.
Самое интересное, что эту способность специально не проектировали. Прям как с большими языковыми моделями: на масштабе оказалось, что модель умеет распознавать новую задачу внутри контекста без изменения весов.
Только теперь вместо текста — физический опыт.
Можно дать модели две отдельные демонстрации: сначала открыть кошелек, а потом достать деньги. Переход между ними никто не показывает — модель сама соединяет действия.
Еще интереснее, что действие можно показать в симуляторе как физический промт, после чего реальный робот попытается повторить его в физическом мире. Проблему Sim2Real-перехода это не отменяет, но симулятор становится еще и интерфейсом постановки задачи.
В некоторых экспериментах человек выполнял действие руками перед камерами робота, а модель переносила его на собственное тело.
Есть и примеры не просто копирования движения. После пяти минут дообучения на задаче с щеткой модель смогла использовать вместо нее банан, а с совком придумала другую стратегию: подцепила предмет и высыпала его в миску.
Generalist AI проверила почти 1,9 млн сцен и не нашла среди них близкого примера такого использования совка.
И это напрямую связано с моим прошлым постом про то, как ИИ-агенты начинают самостоятельно обучать роботов.
Я писал, что физический ИИ, скорее всего, будет состоять не из одной огромной модели, а из агента, который понимает цель, планирует действия, использует память и инструменты и управляет моделями для физического выполнения.
Теперь такой агент потенциально может создавать физические промты: найти похожий опыт в памяти, получить демонстрацию от человека или создать ее в симуляторе и сразу проверить результат на реальном роботе.
Если получилось плохо — изменить пример или дособрать данные. Если навык используется постоянно — сможет дообучить отдельную модель. И тогда тот цикл становится еще короче.
Получается, что физический опыт постепенно становится новым языком программирования роботов.
И, возможно, появится профессия наподобие промт-инженера, но для роботов.
Пока GEN-1.5 закрыта, однако, думаю, это вопрос времени.
#новости
Post #315
1.84K