Собрали для вас подборку интересных работ — от генерации поз схвата до универсальных моделей мира.
GraspGen-X: Cross-Embodiment 6-DOF Diffusion-based Grasping
Фундаментальная модель для генерации 6-DoF-позы схвата по геометрии объекта. Умеет адаптироваться к новым захватам через описание их рабочего объёма без отдельного переобучения. Ранжирует кандидатов по вероятности успешного схвата, используя опыт на миллиардах симуляционных примеров для тысяч объектов.
Быстрый тест на наших любимых объектах выдаёт вполне разумные позы для схвата.
🔗 статья| гитхаб
Hydra-0: Action Flow for Generalist World Modeling and Control
Универсальная модель мира, обусловленная последовательностью действий. Представляет действия робота в виде движения пикселей (action flow) — это позволяет моделировать последствия действий в разных воплощениях, задачах и средах.
Результаты впечатляют: на 90,4% меньшая погрешность при движении робота и на 60,2% — при движении объектов по сравнению с Cosmos-2.5.
🔗 сайт | статья
EmbodimentSemantic: A Spatial Scene-Graph Dataset and Benchmark for Vision-Language Models on Embodied Manipulation Trajectories
Авторы взяли датасет LIBERO-Spatial и построили для него графы пространственных отношений на основе состояния симулятора и геометрических эвристик. На полученных графах сравнили разные VLM по качеству предсказания триплетов. Также исследовали влияние графов на success rate VLA: во время evaluation графы генерировали из текущего состояния симулятора и добавляли к инструкции VLA, чтобы проверить, помогают ли они в задачах манипуляции.
🔗 статья
Q-Learning With World Models
Исследователи из Generalist представили GEN-1.5 — модель, которая способна обучаться новым физическим навыкам по одной демонстрации, без дообучения и градиентных обновлений.
Ключевые фишки:
— Physical prompting: в контекст передаётся полноценная сенсомоторная демонстрация (визуальные наблюдения, состояния робота и действия) — аналог in-context prompt для LLM.
— Масштаб претрейна: модель обучалась более 8 месяцев на большом объёме данных физического взаимодействия. Способность к one-shot in-context learning появилась как emergent property, а не была заложена в архитектуру.
Веса и pipeline пока закрыты, но blogpost уже есть.
🔗 blogpost
Похожее направление — In-Context Imitation Learning with Visual Reasoning (ICLR 2026)
Тоже in-context imitation learning по сенсомоторным демонстрациям, но с дополнительным visual reasoning: модель сначала предсказывает промежуточную визуальную траекторию движения робота в image space, а затем генерирует low-level actions. Reasoning выступает связующим звеном между наблюдением и действием.
Работа принята на IROS 2026, есть статья на arXiv и открытый код — в отличие от GEN-1.5, её уже можно изучать и воспроизводить.
🔗 статья | гитхаб
✏️Читаем, анализируем, берём в работу!
