TGViewer
404 Driver Not Found 404 Driver Not Found @drivernotfound · 1.53K subscribers
Post #95 1.21K
Long-Range 3D Perception — датасет и методы детекции отдалённых объектов

Сегодня вас ждёт подборка статей на тему детекции отдалённых объектов. Это важная задача, поскольку на скорости 100 км/ч автомобиль проезжает ~28 м/с, поэтому для безопасного торможения и перестроения нужно видеть препятствия на расстоянии 150–200 метров, а классические бенчмарки такую дальность обрезают. NuScenes размечен до 50–80 м, KITTI — до 70 м.

Дальние объекты — это отдельная боль: у лидара на 150 метрах на объект остаются единицы точек, на камере он занимает десятки пикселей, и в датасетах таких объектов на порядки меньше ближних, из-за чего модели переобучаются на ближнюю зону. Поэтому начнём с датасета — здесь лучше всего подходит Argoverse 2. Он содержит 1000 размеченных картиночных сцен с семью камерами, объекты размечены на удалении до 200 метров. Каждая сцена длится 30 секунд, частота — 20 fps. Датасет размечен по 30 категориям, причём почти все категории имеют более 10 000 боксов. Лидар работает на 10 Гц.

Основные методы для детекции отдалённых объектов:

LiDAR-only
FSD, FSDv2 — полностью sparse lidar-only модели. Основная идея: собрать точки в группы (соответствующие объектам) и процессить эти группы отдельно. Внутри каждой группы точки предсказывают центры объектов, которые далее используются для предсказания бокса. В v2 кластеризация в группы заменена на работу с виртуальными вокселями (локальное объединение точек). Основные результаты представлены на Argoverse 2 до 200 метров. FSDv2 показывает результаты, близкие к SoTA c latency < 100ms.

Camera-only (Far3D)
Far3Det — чтобы построить модель для отдалённых объектов, авторы решили «почистить» датасет NuScenes от сцен с неполной разметкой, оставив только те, в которых размечены все объекты вплоть до 80 метров. Также предложили вариант адаптивного NMS (AdaNMS) для изменения IoU threshold в зависимости от расстояния.

Far3D — SoTA на NuScenes в сетапе camera-only на момент публикации. Результаты на Argoverse 2 похуже, чем у FSDv2, но это sparse camera-only модель. На основе StreamPETR построена модель, в которой используются адаптивные query. Для их генерации на этапе LSS лучи кидаются на основе 2D-детекций.

Fusion
Towards Long-Range 3D Object Detection for Autonomous Vehicles — статья с двумя улучшениями для детекции отдалённых объектов. Во-первых, это использование двух отдельных сетей для ближних (до 110 м) и отдалённых (от 100 м) объектов с фьюзом детектов на пересечении. Во-вторых, авторы используют Multimodal Virtual Point для генерации псевдолидарных точек на основе 2D Instance Segmentation. Результаты посчитаны для Argoverse 2: каждый из фиксов улучшает FSDv2;

SparseFusion — по сути является sparse-версией BEVFusion. Для обеспечения разреженности все свёрточные операции заменены на sparse. На этапе LSS берутся только top K расстояний из распределения вдоль лучей. Сами лучи кидаются только внутри боксов 2D-детекций. Результаты сравниваются на Argoverse 2. По метрикам SparseFusion немного переигрывает BEVFusion, при этом по latency метод более чем в три раза быстрее. Но на срезе 100–200 метров результаты у BEVFusion чуть лучше.

Что в итоге выбрать?
• LiDAR-only — FSDv2: результаты близкие к SoTA на Argoverse 2 при latency < 100 мс, самый практичный вариант для продакшена.
• Camera-only — Far3D: SoTA на nuScenes, но на Argoverse 2 заметно уступает лидарным методам — камер пока недостаточно для надёжной детекции на 200 м.
• Fusion — SparseFusion: в 3+ раза быстрее BEVFusion при сопоставимом качестве, но на срезе 100–200 м dense-подход всё ещё чуть точнее — на дальности разреженность даёт о себе знать.

Общий тренд хорошо виден: работают sparse-архитектуры вкупе с адаптивными приёмами (AdaNMS, адаптивные query, отдельные головы для разных дальностей). А среди датасетов Argoverse 2 с разметкой до 200 м фактически стал стандартом для long-range задач.

Разбор подготовил ❣️ Иван Лунев
404 driver not found
  • ❤‍🔥 9
  • ❤ 6
  • 🔥 6
  • 👍 2
More from @drivernotfound
  1. Sep 17, 2026Mask2Map: Vectorized HD Map Construction Using Bird's Eye View Segmentation Masks Что буде…
  2. Sep 11, 2026Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous…
  3. Sep 10, 2026Автономный транспорт на ECCV 2026: несколько слов о долгосрочном развитии На воркшопе Emer…
  4. Sep 4, 2026π0.5: a VLA with Open-World Generalization π0 — система, которая помогает делать large-sca…
  5. Aug 28, 2026BEVDiffuser: Plug-and-Play Diffusion Model for BEV Denoising with Ground-Truth Guidance Де…
  6. Aug 20, 2026Learning Rollout from Sampling: An R1-Style Tokenized Traffic Simulation Model Сегодняшняя…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →