TGViewer
rizzearch rizzearch @rizzearch · 1.02K subscribers
Post #860 6.12K
Hi Robot: Open-Ended Instruction Following with Hierarchical
Vision-Language-Action Models


недавно мы уже упоминали о том, что в лоб использовать VLM для задач принятия решений не совсем оптимально, ибо модели такие создавались не на эту задачу

и вот теперь physical intelligence выпустили свое видение на этот счет, только они решили сделать это в более-менее иерархичной структуре (состоящей из двух уровней)

авторы назали Hi Robot (hierarchical interactive robot) - если проводить с концепцией Канемана

- есть Система 1: быстрая политика (в данном случае политика на флоу матчинге, не фаст), она исполняет low-level действия в соответствии с low-level языковыми коммандами и остальной инфой в виде проприоцепции и картинок. назовем это low-level process. языковые промпты кстати итеративно подаются на вход модели, так и могут меняться по ходу исполнения задачи в зависимости от преференций человека
- а есть Система 2: high-level process, который заточен на VLM, получающий текстовый инпут непосредственно от пользователя, а далее в совокупности с другими входными данными модель составляет список низкоуровневых инструкций для Системы 1 + так же здесь есть text-to-speech модуль (кстати для него использовали апи от cartesia.ai, ее мы упоминали здесь), чтобы пользователь мог получать подтверждение о своих запросах, просьбу о пояснении или сообщение об исправлении ошибок (в истории интеракции робота с реальным миром)

и хоть Система 2 получается нагроможденее, ее можно инферить реже чем низкоуровневую Систему 1 → можно сделать так, чтобы они работали с разной частотой и быть (более-менее) в шоколаде

окей, идея звучит очень здраво и возможно даже очевидно (пока дело не доходит до практики), остается вопрос в составлении датасета

датасет же составлялся частично вручную, частично синтетически

- очень детальное описание задач (накрыть на стол, сделать сендвич, пошопиться продуктами) надо было разбивать на низкоуровневую последовательность задач
- а так же еще приправить это все какими-то условиями из world knowledge моделей (e.g. user: “Can you make a sandwich for me? I’m lactose intolerant”. robot: “Sure, I won’t put cheese on it.”)
- и добавить возможность предлагать (а затем стремиться сделать) частное из недетального промпта (например “I want something sweet” в качестве юзер промпта)

кода нет, да и датасета тоже

👀LINK
  • 👍 1
More from @rizzearch
  1. Dec 28, 2025π∗0.6: a VLA That Learns From Experience Давно меня не было😚😚😚 В последний раз про pi.w…
  2. Sep 15, 2025К нам часто поступают запросы на темы для курсовых, дипломных или сайд-проектов вне рамок…
  3. Jul 30, 2025Dynamic Chunking for End-to-End Hierarchical Sequence Modeling меня упомянул Борис среди к…
  4. Jul 25, 2025SRT-H: A Hierarchical Framework for Autonomous Surgery via Language Conditioned Imitation…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →