TGViewer
Channel Public Channel
iMapDAY

iMapDAY

@imapday

Сделал канал для размещения новостей от меня @yuddim и моей команды, занимающейся трехмерным компьютерным зрением роботов и автомобилей. Также давно хотелось собирать в одном месте интересные для меня научные публикации и технологические заметки.
Subscribers
358
Photos
630
Videos
74
Links
176

Showing posts older than #678 · Back to latest

Older Posts 7 shown
Post #677 106
Смог попасть и на другой важный для нас воркшоп о создании цифровых двойников в симуляторах https://awesomedigitaltwin.github.io/2026_ICRA.html

Manolis Savva из Канадского Simon Fraser University (H-index 53) рассказывал про свои свежие разработки:
- SceneMotifCoder https://arxiv.org/abs/2408.02211 (проект с кодом и данными https://3dlg-hcvc.github.io/smc/),
- HSM: Hierarchical Scene Motifs for Multi-Scale Indoor Scene Generation https://arxiv.org/abs/2503.16848 (проект с кодом https://3dlg-hcvc.github.io/hsm),
- SINGAPO: Single Image Controlled Generation of Articulated Parts in Obiects https://arxiv.org/abs/2410.16499 (проект с кодом https://3dlg-hcvc.github.io/singapo),
- ITACO: 2-stage coarse prediction & refinement https://arxiv.org/html/2506.08334v2 (проект с кодом https://3dlg-hcvc.github.io/video2articulation/),
- EgoFun3D: benchmarking egocentric video to functional 3D digital twin reconstruction https://arxiv.org/abs/2604.11038 (проект с кодом и данными https://3dlg-hcvc.github.io/EgoFun3D/),
- Artiverse: A Diverse and Physically Grounded Dataset for Articulated Objects https://arxiv.org/abs/2605.24403 (проект с кодом и данными https://3dlg-hcvc.github.io/artiverse/)

Ingmar Posner из Oxford University (H-index 50) сделал базовый обзор различных моделей мира (World Models) и рассказал про свои работы VCD (Variational Causal Dynamics) , COMET и SPARTAN, про свежие результататы 2026 года правда ничего не рассказал

Ken Goldberg из UC Berkeley и UCSF (H-index 109) рассказывал про моделирование роста растений с помощью трехмерного гауссовского сплаттинга GrowSplat (проект с данными и пока без кода https://berkeleyautomation.github.io/GrowSplat/), а также про разумную концепцию, в которой рассматривался промежуточное синтетическое представление среды для обучения роботов: Real2Render2Real: Scaling Robot Data Without Dynamics Simulation or Robot Hardware (проект с кодом https://real2render2real.com)

Oier Mees из Microsoft (H-index 29), из его работ отмечу SteerVLA: Steering Vision-Language-Action Models in Long-Tail Driving Scenarios (проект пока без кода https://steervla.github.io) и mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs (проект с кодом https://mimic-video.github.io)

На этом воркшопе также выступал Jiajun Wu из Стэнфорда (H-index 94 ) c очень большим количеством публикаций на A*-конференциях в год - он входит в команду Fei-Fei Li. Отмечу его свежие работы про рассуждения на длинных видео и бенчмаркинг:
- Linear Scaling Video VLMs for Long Video Understanding https://arxiv.org/abs/2605.31598 (проект пока без кода https://ceyzaguirre4.github.io/StateKV/),
- GPIC: A Giant Permissive Image Corpus for Visual Generation https://arxiv.org/abs/2605.30341 (проект с данными https://gpic.stanford.edu/),
- ESI-Bench: Towards Embodied Spatial Intelligence that Closes the Perception-Action Loop https://arxiv.org/abs/2605.18746 (проект с кодом https://esi-bench.github.io).

#ICRA
awesomedigitaltwin.github.io ICRA 2026 Workshop on Generative Digital Twins Generative Digital Twins for Real2Sim and Sim2Real Transfer in Robotics at IEEE ICRA 2026.
  • ❤ 1
Post #667 108
Немного фото и видео с этого воркшопа
Post #666 118
На этом MM-SpatialAI-воркшопе были интересные постеры:
- Efficient Feature-Free Initialization for Monocular Visual-Inertial Systems Using a Feed-Forward 3D Model (проект пока без кода https://github.com/Yuantai-Z/FF-VIO-Init)
- FlowHOI: Flow-based Semantics-Grounded Generation of Hand-Object Interactions for Dexterous Robot Manipulation (проект с кодом https://huajian-zeng.github.io/projects/flowhoi/)
-RADIO-ViPE: Online Tightly Coupled Multi-Modal Fusion for Open-Vocabulary Semantic SLAM in Dynamic Environments (проект с кодом https://be2rlab.github.io/radio_vipe)
- DCReg: Decoupled Characterization for Efficient Degenerate LiDAR Registration (код https://github.com/JokerJohn/DCReg)
- ScaRF-SLAM: A Framework for Globally Consistent Online Visual Dense Reconstruction (код https://github.com/ori-drs/ScaRF-SLAM)
- Learning to Localize Reference Trajectories in Image-Space for Visual Navigation (проект с кодом https://finnbusch.com/lotis)
- ScanNet-SG: A Large-Scale Dataset for 3D Scene Graph Alignment (код и данные https://github.com/tud-amr/ScanNet-SG)
- UniFField: A Generalizable Unified Neural Feature Field for Visual, Semantic, and Spatial Uncertainties in Any Scene (проект пока без кода https://sites.google.com/view/uniffield)
arXiv.org Efficient Feature-Free Initialization for Monocular... Fast and reliable initialization is critical for monocular visual-inertial navigation systems (VINS), as it establishes the starting conditions for subsequent state estimation. Despite steady...
Post #663 131
Напишу про воркшопы на конференции ICRA’2026. Их отобрали из 150 заявок целых 70 штук и они параллельно шли в первый и последний день конференции. Они как и на IROS являлись украшением конференции. Почти все пленарные докладчики и keynotes выступали (и иногда дублировали свои «большие» выступления) на воркшопах - сами или со своими студентами. И естественно, там было проще было задавать им вопросы, знакомиться и тп.

В первый день конференции мне удалось побывать на нескольких воркшопах:

На воркшопе по мультимодальному пространственному ИИ было много того, чем мы активно занимаемся в МФТИ и AIRI

Andrew Davison из Imperial College London (H-index 83) рассказывал актуальный свежий взгляд на проблему «From SLAM to Spatial Al». Он говорил о методах разработанных его командой: SuperPrimitives (CVPR 2024) (проект с кодом https://makezur.github.io/SuperPrimitive/), 4D Primitive Maché (4DPM) (CVPR 2026) (проект с кодом https://makezur.github.io/4DPM/), также он дал свой взгляд на структуру современного Spatial AI, высказал идею про graph-like процессор для анализа пространственной информации

Dezhen Song из Mbuzai (H-index 33 ) также рассказывал про графовые методы в пространственном ИИ и показал свой метод учета данных магнетометров для локализации: Proprioceptive Localization Assisted by Magnetoreception (PLAM), а также кооперативной локализации C-GBPL , которые оказались не такими уж и свежими.

Margarita Chli из ETH Zurich (H-index 46) рассказывала о своей свежей работе EllipseLIO: Adaptive LiDAR Inertial Odometry with an Ellipsoid Representation (код https://github.com/v4rl-ucy/ellipselio). Лидарные методы для локализации и построения карт сейчас набирают обороты, их было много на конференции.

Про будущее построения роботами карт рассказывал Hermann Blum из Uni Bonn & Lamarr Institute (H-index 21). Показал свою относительно свежую работу 2GO: Loop Closures from 2 Views , FrontierNet (код https://github.com/cvg/FrontierNet ), OpenFrontier: Reconstruction Free Open-Prompt Navigation (проект пока без кода https://boysun045.github.io/OpenFrontier-Project/), OsmAG-LLM: finding unknown and relocated objects (код https://anonymous.4open.science/r/osmAG-LLM), FunFact: Probabilistic Functional Scene Graphs (проект пока без кода https://funfact-scenegraph.github.io). Его стек работ очень близок к нашим работам, он также отмечается важность фундаментальных моделей для задач навигации и построения карт.

Alex Wong из Yale University (H-index 25) рассказывал про подходы к построению универсальных методов реконструкции карт глубин из монокулярного видео и с какими трудностями при этом встречаются исследователи на примере своей работы ProtoDepth: Unsupervised Continual Depth Completion with Prototypes (код https://github.com/patrickqrim/ProtoDepth)

Sebastian Scherer (H-index 64) много улыбался и шутил и говорил про мультимодальное очувствление, сфокусировавшись на создании универсальное сферическое представление изображений, который может повысить качество переноса моделей распознавания сцены между разными сенсорами.

#ICRA
xingxingzuo.github.io Web home for the Workshop for MMSpatialAI @ ICRA2026
  • 👍 1
  • 🔥 1
Post #659 137
Конечно же были на ICRA’26 и необычные конструкции роботов, вот немного фото и видео с ними

#ICRA
  • ❤ 4
  • 🔥 1
Post #653 128
Были на ICRA’26 стенды и про симуляторы и ПО обработки сенсоров. Много было также и разных летающих дронов, даже Matlab/Mathworks на своем стенде предлагал промоделировать дрон самолетного типа.

#ICRA
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →