ИИ-агенты выходят в физический мир: кажется, мы начинаем по-другому обучать роботов
Недавно Humanoid — один из клиентов моей компании — стал первым в Европе единорогом в сфере гуманоидной робототехники.
Многие знают меня по внедрению ИИ в бизнес, но я также занимаюсь робототехникой.
Когда я консультировал Humanoid, у меня уже был опыт ускорения разработки и обучения беспилотников в симуляции.
Поэтому возник вопрос: а что, если совместить эти подходы и ускорить создание новых навыков для роботов?
На заводе роботу не нужно абстрактное «умение быть человеком»: часто нужно взять объект и положить его в нужное место. Причем две ноги не всегда преимущество — практичнее колесная платформа, а главная ценность в работе руками.
Другой объект, положение или рабочая зона — и уже нужны новые данные для обучения. Одна из ключевых проблем робототехники — Sim2Real-переход: то, что работает в симуляции, может не работать в суровой реальности из-за отличий в физике или шума сенсоров.
Данные собирают через телеуправление и эгоцентрические видео, но действие все равно кто-то должен выполнить тысячи раз. С беспилотниками мы решали это симуляцией.
С роботами проблема не в ускорении написания кода. Humanoid — один из моих кейсов с AI-Native-средой: разработчики активно используют ИИ, а агенты работают даже ночью. Но если код пишется в пять раз быстрее, робот не начинает в пять раз быстрее учиться. После кода начинается физический эксперимент.
Скажем: «подними коробку». Робот поднял — и тут же бросил в потолок. Формально задача выполнена, но функция вознаграждения задана плохо.
Тут я предложил перенести в физический ИИ принцип из AI-Native-разработки, но добавить новые уровни проверки.
В разработке ПО есть подход TDD (Test-Driven Development): сначала описываем тесты, а затем ИИ должен их пройти. В робототехнике после программных тестов добавляются симуляция, лабораторная среда и физические тесты.
Здесь стек валидации глубже: ошибка в физическом мире может закончиться разбитым оборудованием или травмой человека.
Но даже так мы лишь ускоряем существующий пайплайн. Узкое место остается: физический опыт все равно нужно получить — через симуляции, реальные эксперименты, время и затраты на вычисления.
В разработке ПО мы радикально ускорили производство кода. Для роботов теперь нужно радикально ускорить производство опыта.
Возможно, стоит не ускорять сам пайплайн, а менять пайплайн обучения.
Я уже писал про VLA. Теперь поверх этого появляется ИИ-агент. Поэтому мне стал интересен подход Code as Policies и agentic robotics: агент получает задачу, использует восприятие, навыки и модели, пишет программу поведения, запускает ее, смотрит на результат и исправляет решение.
ИИ сам становится участником физического эксперимента: он пробует, обнаруживает ошибку и повторяет попытку.
VLA и политики никуда не исчезают: сверху размышляющий агент планирует, ниже работают VLA, восприятие и навыки — считайте, «MCP для роботов», а контроллеры управляют физикой.
Успешные решения можно сохранять как переиспользуемые навыки, а робота использовать для производства собственных данных.
Так ИИ учится задавать поведение робота, а робот — сам производить данные для следующего обучения.
Больше роботов дают больше физического опыта. Больше опыта позволяет строить лучшие навыки и политики. А лучшие политики делают следующие эксперименты дешевле.
Решил глубже разобраться в этом вопросе и написал об этом новую статью.
Вчера ИИ-агенты работали в цифровом мире, а теперь получают «доступ к телу».
У меня есть EEG-повязка, к которой я приделал ИИ, чтобы стоически отделять свои автоматические эмоции от взвешенных решений – помогает.
Теперь жду экспериментальные умные очки из одной лаборатории, а также своего первого робота. Начну с «мозгов», потом добавлю руки и ноги, буду писать об этом.
Раньше я думал, что метавселенные станут массовыми раньше роботов. Но сейчас уже так не кажется.
ИИ становится рабочей силой не только в цифровой, но и в физической экономике.
И вот это действительно может навсегда изменить наш мир.
👉 Полная статья
#технологии
Post #314
1.88K