Post #677
106
Смог попасть и на другой важный для нас воркшоп о создании цифровых двойников в симуляторах https://awesomedigitaltwin.github.io/2026_ICRA.html
Manolis Savva из Канадского Simon Fraser University (H-index 53) рассказывал про свои свежие разработки:
- SceneMotifCoder https://arxiv.org/abs/2408.02211 (проект с кодом и данными https://3dlg-hcvc.github.io/smc/),
- HSM: Hierarchical Scene Motifs for Multi-Scale Indoor Scene Generation https://arxiv.org/abs/2503.16848 (проект с кодом https://3dlg-hcvc.github.io/hsm),
- SINGAPO: Single Image Controlled Generation of Articulated Parts in Obiects https://arxiv.org/abs/2410.16499 (проект с кодом https://3dlg-hcvc.github.io/singapo),
- ITACO: 2-stage coarse prediction & refinement https://arxiv.org/html/2506.08334v2 (проект с кодом https://3dlg-hcvc.github.io/video2articulation/),
- EgoFun3D: benchmarking egocentric video to functional 3D digital twin reconstruction https://arxiv.org/abs/2604.11038 (проект с кодом и данными https://3dlg-hcvc.github.io/EgoFun3D/),
- Artiverse: A Diverse and Physically Grounded Dataset for Articulated Objects https://arxiv.org/abs/2605.24403 (проект с кодом и данными https://3dlg-hcvc.github.io/artiverse/)
Ingmar Posner из Oxford University (H-index 50) сделал базовый обзор различных моделей мира (World Models) и рассказал про свои работы VCD (Variational Causal Dynamics) , COMET и SPARTAN, про свежие результататы 2026 года правда ничего не рассказал
Ken Goldberg из UC Berkeley и UCSF (H-index 109) рассказывал про моделирование роста растений с помощью трехмерного гауссовского сплаттинга GrowSplat (проект с данными и пока без кода https://berkeleyautomation.github.io/GrowSplat/), а также про разумную концепцию, в которой рассматривался промежуточное синтетическое представление среды для обучения роботов: Real2Render2Real: Scaling Robot Data Without Dynamics Simulation or Robot Hardware (проект с кодом https://real2render2real.com)
Oier Mees из Microsoft (H-index 29), из его работ отмечу SteerVLA: Steering Vision-Language-Action Models in Long-Tail Driving Scenarios (проект пока без кода https://steervla.github.io) и mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs (проект с кодом https://mimic-video.github.io)
На этом воркшопе также выступал Jiajun Wu из Стэнфорда (H-index 94 ) c очень большим количеством публикаций на A*-конференциях в год - он входит в команду Fei-Fei Li. Отмечу его свежие работы про рассуждения на длинных видео и бенчмаркинг:
- Linear Scaling Video VLMs for Long Video Understanding https://arxiv.org/abs/2605.31598 (проект пока без кода https://ceyzaguirre4.github.io/StateKV/),
- GPIC: A Giant Permissive Image Corpus for Visual Generation https://arxiv.org/abs/2605.30341 (проект с данными https://gpic.stanford.edu/),
- ESI-Bench: Towards Embodied Spatial Intelligence that Closes the Perception-Action Loop https://arxiv.org/abs/2605.18746 (проект с кодом https://esi-bench.github.io).
#ICRA
Manolis Savva из Канадского Simon Fraser University (H-index 53) рассказывал про свои свежие разработки:
- SceneMotifCoder https://arxiv.org/abs/2408.02211 (проект с кодом и данными https://3dlg-hcvc.github.io/smc/),
- HSM: Hierarchical Scene Motifs for Multi-Scale Indoor Scene Generation https://arxiv.org/abs/2503.16848 (проект с кодом https://3dlg-hcvc.github.io/hsm),
- SINGAPO: Single Image Controlled Generation of Articulated Parts in Obiects https://arxiv.org/abs/2410.16499 (проект с кодом https://3dlg-hcvc.github.io/singapo),
- ITACO: 2-stage coarse prediction & refinement https://arxiv.org/html/2506.08334v2 (проект с кодом https://3dlg-hcvc.github.io/video2articulation/),
- EgoFun3D: benchmarking egocentric video to functional 3D digital twin reconstruction https://arxiv.org/abs/2604.11038 (проект с кодом и данными https://3dlg-hcvc.github.io/EgoFun3D/),
- Artiverse: A Diverse and Physically Grounded Dataset for Articulated Objects https://arxiv.org/abs/2605.24403 (проект с кодом и данными https://3dlg-hcvc.github.io/artiverse/)
Ingmar Posner из Oxford University (H-index 50) сделал базовый обзор различных моделей мира (World Models) и рассказал про свои работы VCD (Variational Causal Dynamics) , COMET и SPARTAN, про свежие результататы 2026 года правда ничего не рассказал
Ken Goldberg из UC Berkeley и UCSF (H-index 109) рассказывал про моделирование роста растений с помощью трехмерного гауссовского сплаттинга GrowSplat (проект с данными и пока без кода https://berkeleyautomation.github.io/GrowSplat/), а также про разумную концепцию, в которой рассматривался промежуточное синтетическое представление среды для обучения роботов: Real2Render2Real: Scaling Robot Data Without Dynamics Simulation or Robot Hardware (проект с кодом https://real2render2real.com)
Oier Mees из Microsoft (H-index 29), из его работ отмечу SteerVLA: Steering Vision-Language-Action Models in Long-Tail Driving Scenarios (проект пока без кода https://steervla.github.io) и mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs (проект с кодом https://mimic-video.github.io)
На этом воркшопе также выступал Jiajun Wu из Стэнфорда (H-index 94 ) c очень большим количеством публикаций на A*-конференциях в год - он входит в команду Fei-Fei Li. Отмечу его свежие работы про рассуждения на длинных видео и бенчмаркинг:
- Linear Scaling Video VLMs for Long Video Understanding https://arxiv.org/abs/2605.31598 (проект пока без кода https://ceyzaguirre4.github.io/StateKV/),
- GPIC: A Giant Permissive Image Corpus for Visual Generation https://arxiv.org/abs/2605.30341 (проект с данными https://gpic.stanford.edu/),
- ESI-Bench: Towards Embodied Spatial Intelligence that Closes the Perception-Action Loop https://arxiv.org/abs/2605.18746 (проект с кодом https://esi-bench.github.io).
#ICRA
- ❤ 1

















