TGViewer
404 Driver Not Found 404 Driver Not Found @drivernotfound · 1.53K subscribers
Post #99 946
π0.5: a VLA with Open-World Generalization

π0 — система, которая помогает делать large-scale pre-training для робототехники, где нет web-scale-датасетов. Как она устроена, рассказывали в одном из предыдущих постов. А сегодня разберём статью о новой версии системы — π0.5.

В статье речь идёт о роботах-манипуляторах, но сама идея общая задача → semantic subtask → low-level actions выглядит применимой и к другим embodied-системам — например, автономному транспорту.

Чтобы превратить π0 в π0.5, авторы придумали несколько важных вещей. Во-первых, токенайзер FAST:

🔴 переводят траектории в частотное представление с помощью discrete cosine transform (DCT),
🔴 обнуляют незначимые коэффициенты,
🔴 оставшиеся коэффициенты разворачивают в одномерную последовательность и объединяют в BPE-токены.

На этапе претрейна next-token-prediction с CE учится гораздо быстрее диффузии и легко смешивается с другими задачами для претрейна VLM (ещё вернёмся к этому). На post-train добавляется диффузионный action-эксперт, с помощью которого итоговая модель предсказывает непрерывные траектории.

Во-вторых, модель учат предсказывать не только действия, но и подзадачи. Например, «взять подушку» для задачи «убраться в спальне». Для этого используют как размеченные траектории роботов, так и обычные vision-language-данные из интернета — картинки с текстовой разметкой (их на порядки больше, чем траекторий).

Таким образом, в претрейне используют очень разнородные материалы: траектории разных роботов, задачи на предсказание высокоуровневых действий и VLM-данные из интернета. Авторы называют этот подход heterogeneous co-training и связывают с ним способность модели обобщаться на новые окружения и задачи.

Этап 1. Тело VLM претрейнят на смеси данных. Для размеченных траекторий модель сначала предсказывает текстовые токены подзадачи, а на их основе — FAST-токены траектории.

Этап 2. На пост-трейне добавляется action-эксперт. Вся модель файнтьюнится под мобильных роботов-манипуляторов с помощью CE для FAST-токенов и flow-matching loss для непрерывной траектории. При этом эксперт видит весь префикс, включая подзадачу, но не FAST-токены.

Для быстрого инференса FAST-токены уже не генерируются. Модель сначала определяет высокоуровневую подзадачу, затем эксперт предсказывает непрерывную траекторию на её основе.

Эксперименты показали, что такой подход к обучению помогает улучшить генерализацию: робосистема начинает лучше справляться с долгосрочными многошаговыми задачами. Для автономных роботов это, например, самостоятельная уборка целой комнаты в незнакомом доме.

Разбор подготовил ❣️ Сергей Репьевский
404 driver not found
  • ❤ 11
  • 🔥 3
  • 🤩 3
  • 😁 2
  • ❤‍🔥 1
  • 🥰 1
More from @drivernotfound
  1. Sep 17, 2026Mask2Map: Vectorized HD Map Construction Using Bird's Eye View Segmentation Masks Что буде…
  2. Sep 11, 2026Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous…
  3. Sep 10, 2026Автономный транспорт на ECCV 2026: несколько слов о долгосрочном развитии На воркшопе Emer…
  4. Aug 28, 2026BEVDiffuser: Plug-and-Play Diffusion Model for BEV Denoising with Ground-Truth Guidance Де…
  5. Aug 20, 2026Learning Rollout from Sampling: An R1-Style Tokenized Traffic Simulation Model Сегодняшняя…
  6. Aug 13, 2026LISO: Lidar-only Self-Supervised 3D Object Detection Разметка 3D-боксов очень дорогая, дол…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →