TGViewer
Книжный куб Книжный куб @book_cube · 15.7K subscribers
Post #4822 2.38K
Челси Финн: GPT-эра робототехники на пороге (Рубрика #Robotics)

Посмотрел выступление Челси Финн «This Is the State of the Art in Robotics» на Startup School 2026, опубликованное 12 августа 2026 года. За эффектными демо Финн предлагает увидеть более важный сдвиг: ChatGPT стал общей моделью для работы с текстом, а Physical AI пытается сделать то же для действий в реальном мире.

Параллель здесь архитектурная. Вместо отдельного конвейера под каждую задачу — одна предобученная основа, которой дают разные инструкции. Physical Intelligence переносит этот принцип в робототехнику: от политики под одну операцию и одного робота к общей vision-language-action модели (VLA). На входе у неё изображения, инструкция и контекст, на выходе — управляющие действия. Правда, робот сходу должен работать без human in the loop — он сам меняет среду, а у пролитого кофе или столкновения нет кнопки undo. Поэтому Physical AI становится полезным не после удачного демо, а когда система часами работает без постоянного присмотра и восстанавливается после ошибок.

Финн показывает три части такого контура.

1️⃣ Разнородные данные

У LLM есть огромный корпус текстов, но готового «интернета физических действий» нет. Вместо этого используются демонстрации операторов, автономные попытки, видео людей, данные из интернета и траектории разных роботов. Видео помогает понять задачу, а моторный навык приходится нарабатывать на самой машине.
2️⃣ Обучение с подкреплением на собственном опыте
Когда робот оказывается в тупике, то оператор показывает роботу способ восстановления, а модель ценности (value function) оценивает движение к успеху, затем VLA дообучается на этих попытках. По данным Physical Intelligence, RECAP более чем вдвое повысил пропускную способность на части сложных задач и примерно вдвое сократил отказы. Для эспрессо компания сообщает об успехе выше 90% и 13-часовом прогоне повторяющегося сценария. Это результаты команды, а не независимая проверка.
3️⃣ Память
Для уборки кухни мало текущих показаний сенсоров: нужно помнить завершённые шаги. В системе MEM (Multi-Scale Embodied Memory) короткая история остаётся видео, а длинная сжимается в текст. Получается любопытная инверсия: язык внутри робота служит планом и памятью, а моторный навык рождается из физического опыта.

Новая π0.7 объединяет инструкцию, ближайшую подзадачу, сведения о качестве данных и визуальную подцель от модели мира. По утверждению компании, единая VLA-модель сравнялась со специализированными политиками и показала ранние признаки композиционного обобщения — переноса знакомых навыков на новые сочетания задач и роботов. Универсальный робот из этого пока не получился.

Финн делает важную оговорку: буквального «момента ChatGPT» может не быть. Софт распространяется мгновенно, а машины нужно произвести, установить и обслуживать. GPT-эра робототехники будет похожа не на миллион пользователей за пять дней, а на постепенный рост числа задач, которые одна модель выполняет надёжно и автономно.

Для меня главный вывод такой: «ChatGPT для физического мира» близится и общими будут модель, инструкция и перенос знаний между задачами. Также Physical AI нужны собственный опыт, память, проверки качества, безопасное восстановление и измеримая надёжность. ChatGPT научил модели работать со смыслами текстов, а робототехнике ещё предстоит доказать, что смыслы можно стабильно превращать в действия в реальном мире.

#Robotics #AI #Engineering #Research #Architecture
YouTube Chelsea Finn: This is the State of the Art in Robotics Robots can already fold laundry, make espresso, clean kitchens, and assemble things. The harder problem is getting them to do those tasks reliably, for long periods of time, without a human babysitting them. At Startup School 2026, Physical Intelligence…
  • ❤ 5
  • 🔥 4
  • 👍 2
More from @book_cube
  1. Oct 3, 2026Где деньги в своих данных: цены, клиенты, ассортимент — материалы второго выпуска (Рубрика…
  2. Oct 2, 2026Как AI меняет роль техлида: запись круглого стола (Рубрика #AI4SDLC) Если агент пишет код,…
  3. Oct 2, 2026Stanford CME295: погружение в основы LLM (Рубрика #AI) Начал изучать курс Stanford CME295…
  4. Oct 2, 2026Заходите на прямой эфир с Сергеем Киселевым, head of devplatform в MWS, где мы обсудим тем…
  5. Oct 2, 2026Anthropic: кто будет делать следующий ИИ (Рубрика #AI) Если ИИ помогает создавать следующу…
  6. Oct 1, 20263 AImigo S1E8: AI-native: что это значит для компании? (Рубрика #Management) Раздать сотру…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →