TGViewer
Center for Cognitive Modeling Center for Cognitive Modeling @cogmodel · 1.79K subscribers
Post #1193 1.24K
🪼Дайджест ЦКМ: что мы читали на этой неделе

Собрали для вас подборку интересных работ — от генерации поз схвата до универсальных моделей мира.

GraspGen-X: Cross-Embodiment 6-DOF Diffusion-based Grasping
Фундаментальная модель для генерации 6-DoF-позы схвата по геометрии объекта. Умеет адаптироваться к новым захватам через описание их рабочего объёма без отдельного переобучения. Ранжирует кандидатов по вероятности успешного схвата, используя опыт на миллиардах симуляционных примеров для тысяч объектов.

Быстрый тест на наших любимых объектах выдаёт вполне разумные позы для схвата.

🔗 статья| гитхаб

Hydra-0: Action Flow for Generalist World Modeling and Control

Универсальная модель мира, обусловленная последовательностью действий. Представляет действия робота в виде движения пикселей (action flow) — это позволяет моделировать последствия действий в разных воплощениях, задачах и средах.

Результаты впечатляют: на 90,4% меньшая погрешность при движении робота и на 60,2% — при движении объектов по сравнению с Cosmos-2.5.

🔗 сайт | статья

EmbodimentSemantic: A Spatial Scene-Graph Dataset and Benchmark for Vision-Language Models on Embodied Manipulation Trajectories
Авторы взяли датасет LIBERO-Spatial и построили для него графы пространственных отношений на основе состояния симулятора и геометрических эвристик. На полученных графах сравнили разные VLM по качеству предсказания триплетов. Также исследовали влияние графов на success rate VLA: во время evaluation графы генерировали из текущего состояния симулятора и добавляли к инструкции VLA, чтобы проверить, помогают ли они в задачах манипуляции.

🔗 статья

Q-Learning With World Models
Исследователи из Generalist представили GEN-1.5 — модель, которая способна обучаться новым физическим навыкам по одной демонстрации, без дообучения и градиентных обновлений.

Ключевые фишки:
— Physical prompting: в контекст передаётся полноценная сенсомоторная демонстрация (визуальные наблюдения, состояния робота и действия) — аналог in-context prompt для LLM.
— Масштаб претрейна: модель обучалась более 8 месяцев на большом объёме данных физического взаимодействия. Способность к one-shot in-context learning появилась как emergent property, а не была заложена в архитектуру.

Веса и pipeline пока закрыты, но blogpost уже есть.

🔗 blogpost

Похожее направление — In-Context Imitation Learning with Visual Reasoning (ICLR 2026)
Тоже in-context imitation learning по сенсомоторным демонстрациям, но с дополнительным visual reasoning: модель сначала предсказывает промежуточную визуальную траекторию движения робота в image space, а затем генерирует low-level actions. Reasoning выступает связующим звеном между наблюдением и действием.

Работа принята на IROS 2026, есть статья на arXiv и открытый код — в отличие от GEN-1.5, её уже можно изучать и воспроизводить.

🔗 статья | гитхаб

✏️Читаем, анализируем, берём в работу!
  • ❤‍🔥 11
  • 🔥 4
More from @cogmodel
  1. Sep 30, 2026🎓 — Семинар 4. Следование языковым инструкциям в воплощённой среде: планирование с LLM и…
  2. Sep 24, 2026💫 — Начинаем семинар, присоединяйтесь к трансляции в ВК или на YouTube!
  3. Sep 23, 2026🎓 — Семинар 3. Анализ динамики обучения и геометрии представлений в глубоких нейронных се…
  4. Sep 18, 2026🧠 — Не только наука: наши сотрудники развивают робототехнику среди молодёжи Мы часто расс…
  5. Sep 17, 2026💫 — Начинаем семинар, присоединяйтесь к трансляции в ВК или на YouTube
  6. Sep 17, 2026🎓 — Семинар 2. Интеллектуальный 3D-трекинг для построения графов сцены и ответов на вопро…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →