TGViewer
404 Driver Not Found 404 Driver Not Found @drivernotfound · 1.53K subscribers
Post #111 374
Mask2Map: Vectorized HD Map Construction Using Bird's Eye View Segmentation Masks

Что будет, если объединить лучшие практики из Deformable-DeTR, DN-DeTR, Mask2Former, MapTR и MapTR v2? Узнаем из статьи о Mask2Map — методе построения векторных HD-карт по данным автомобильных сенсоров.

Главная идея довольно проста: получить хорошее представление дорожной разметки в виде BEV-масок, а затем использовать эти маски как геометрическую подсказку для векторного декодера.

Mask2Map состоит из двух основных частей:

🔴 IMPNet строит instance-level сегментацию по BEV-фичам сенсоров и формирует маски вместе с соответствующими query.

🔴 MMPNet превращает эту информацию в векторные элементы карты: предсказывает их класс, геометрию и порядок точек.

Пайплайн начинается с построения BEV-представления. Фичи от сенсоров переводят в BEV и обрабатывают на нескольких масштабах. Дальше Mask2Former-подобная часть выполняет инстанс-сегментацию: получает собственную маску и эмбеддинг объекта для каждого элемента карты.

После этого плотную маску нужно превратить в компактное геометрическое представление. Для этого её бинаризуют, прореживают скользящим окном, оставляя репрезентативные точки, и в конце применяют Farthest Point Sampling (FPS). В результате вместо большого числа пикселей остаётся небольшой набор пространственных координат (x, y).

Параллельно модули PQG и GFE формируют query и добавляют в них семантическую и геометрическую информацию из BEV. Идея в том, чтобы дать декодеру более осмысленную стартовую точку, чем полностью свободные обучаемые эмбеддинги.

Дальше всё это попадает в Mask-Guided Map Decoder. Полученные из масок точки используются как геометрические подсказки и опорные точки для деформируемого кросс-аттеншна, после чего декодер восстанавливает итоговую векторную геометрию элементов HD-карты.

Если совсем упростить, архитектуру можно представить так: сенсоры → BEV → instance masks → опорные точки → vector map. То есть левая часть Mask2Map во многом напоминает Mask2Former, а правая — MapTR/Deformable DETR, связанные BEV-масками, которые дают векторному декодеру сильный spatial prior.

Вместо того чтобы заставлять DETR-подобный декодер полностью с нуля искать геометрию дорожных элементов, авторы сначала решают более простую задачу сегментации, а затем используют её результат для инициализации и направления векторного предсказания.

Отдельно во время обучения используется знакомая по DN-DETR идея расшумления queries: GT-объекты искусственно зашумляются, после чего модель учится восстанавливать исходную геометрию. Это помогает стабилизировать обучение и облегчает сопоставление query с объектами карты.

По результатам авторов Mask2Map на момент публикации заметно превосходил предыдущие методы на nuScenes и Argoverse2: прирост составлял до 10,1% mAP и 4,1% mAP. Познакомиться с кодом можно на GitHub проекта.

Разбор подготовил ❣️ Денис Глазов
404 driver not found
  • 🔥 9
  • ❤ 5
  • 👍 4
  • 🤯 2
  • 🎉 1
More from @drivernotfound
  1. Sep 11, 2026Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous…
  2. Sep 10, 2026Автономный транспорт на ECCV 2026: несколько слов о долгосрочном развитии На воркшопе Emer…
  3. Sep 4, 2026π0.5: a VLA with Open-World Generalization π0 — система, которая помогает делать large-sca…
  4. Aug 28, 2026BEVDiffuser: Plug-and-Play Diffusion Model for BEV Denoising with Ground-Truth Guidance Де…
  5. Aug 20, 2026Learning Rollout from Sampling: An R1-Style Tokenized Traffic Simulation Model Сегодняшняя…
  6. Aug 13, 2026LISO: Lidar-only Self-Supervised 3D Object Detection Разметка 3D-боксов очень дорогая, дол…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →