Carolina Parada [ DeepMind ] / p.1
2025 / Обобщение - VLA + VLM
Мы начали внедрять большие языковые модели и foundation-модели в робототехнику, и внезапно открылась возможность, что роботы могут понимать людей. Понимать естественный язык. Интерпретировать сцену — то, что раньше приходилось жестко программировать. Это делает технологию гораздо более доступной для разных приложений. Затем мы ввели концепцию VLA — visual language action моделей, которые переносят знания из веб-концептов, которые робот физически никогда не видел, но при этом могут действовать. Вы можете сказать: «Собери все карандаши вместе», и робот поймет, что это значит, даже если никто не обучал его конкретной фразе «собери карандаши вместе». VLA — это visual language action модель. Обычно, когда говорят об ИИ, имеют в виду мультимодальные модели, VLM — visual language models. Такая модель понимает мир через зрение и язык и может рассуждать. Выход VLA — это действия, которые двигают робота. Выход VLM — это цепочка рассуждений и ответ на вопрос. Это позволяет переносить большое количество информации из семантического пространства, из мультимодальных и world-моделей в пространство действий, делая модель более универсальной. Это и позволяет создавать роботов общего назначения. Но все равно нужны прорывы, чтобы масштабироваться до уровня других foundation-моделей.
2025 / AGI в физическом мире
Мы всегда хотели решить общую задачу интеллекта — AGI. Моя команда сосредоточена на AGI в физическом мире.
2025 / Гуманоидные роботы для дома - последняя стадия
Дом — более поздний рубеж. Не потому что мы не сможем решать задачи в доме — технологии развиваются очень быстро, — а потому что дом требует более высокого уровня безопасности, приватности и защиты. Это займет время. Сначала логистика, производство, ритейл, затем здравоохранение — пространства более структурированные, но с большим разнообразием задач. Все простое там уже автоматизировано. В логистике остались сложные случаи.
2025 / Проблема обучения через наблюдение - foundation model
Мечта любого робототехника — чтобы робот мог смотреть видео или наблюдать за людьми, выполняющими задачи, и учиться из этого. Мы сами так учимся — наблюдая за другими. Раньше в команде все говорили: это случится после нашей карьеры. А сейчас мы обсуждаем — это через 5 лет или через 10? За последние годы мы внедрили LLM и VLM в робототехнику как инструменты планирования. Это позволило роботам понимать язык и абстрактные инструкции — например, разложить блоки по цветам в разные углы. Мы представили VLA — visual-language-action модель, позволяющую учиться на web-scale данных и переносить концепции в действия.
2025 / Обобщение - VLA + VLM
Сейчас робот — как двухлетний ребёнок: понимает мир, играет с объектами, знает концепции. Но если учить его, например, складывать оригами, ему нужно время практиковаться. После практики он сможет это делать. Но до повседневных пространств ещё далеко. Самое впечатляющее — это ситуации, которых робот раньше не видел. Даже мы не знали, справится ли он. И во многих случаях он справлялся. Один из примеров — слэм-данк. Команда принесла игрушки, которых робот не видел. Среди них — маленькое баскетбольное кольцо и мяч. Робота попросили сделать слэм-данк. Он никогда не видел баскетбол и эту игрушку. Через долю секунды он положил мяч в кольцо. Он опирался на понимание Gemini — что такое баскетбол и что такое слэм-данк — и выполнил правильное движение.
Post #117
282