TGViewer
Machinelearning Machinelearning @ai_machinelearning_big_data · 280K subscribers
Post #9834 23.6K
🌟 WildDet3D: открытая модель монокулярной 3D-детекции по одному снимку.

Институт Аллена представил модель WildDet3D, которая по одному изображению строит 3D-рамки объектов: оценивает их положение, размер и ориентацию в метрических координатах.

Модель принимает сразу несколько типов промптов: текстовый запрос, клик по точке или готовый 2D-бокс от внешнего детектора.

🟡Архитектура состоит из 3 блоков

2D-детектор построен на SAM3 и обрабатывает все типы запросов.

Геометрическая ветка использует энкодер DINOv2 с обучаемым декодером глубины, учитывающим геометрию обзора: направления лучей камеры зашиваются через сферические гармоники, что снимает необходимость в отдельной калибровке.

Третий компонент, 3D-head, объединяет через кросс-внимание 2D-детекции с признаками глубины и поднимает их в полноценные 3D-боксы.

Если на инференсе доступны данные с LiDAR, ToF или стереокамеры, они подмешиваются в ту же геометрическую ветку без переобучения.

🟡Тесты

На бенчмарке Omni3D модель показывает 34,2 AP с текстовыми промптами (это +5,8 пункта к прежнему лидеру 3D-MOOD).

На zero-shot переносе на Argoverse 2 WildDet3D практически удваивает прежний результат: 40,3 ODS против 23,8.

На редких категориях из собственного бенчмарка WildDet3D-Bench успехи, разумеется, еще лучше - 47,4 AP против 2,4 у 3D-MOOD.

🟡Вместе с моделью вышло демо-приложение для iOS.

Оно использует видеопоток с камеры iPhone и данные LiDAR-сенсора, чтобы в реальном времени отрисовывать 3D-боксы поверх сцены как AR-оверлей.

Это наглядная демонстрация того, как монокулярная модель усиливается, когда устройство умеет отдавать дополнительный сигнал глубины.

🟡Третья часть релиза - датасет WildDet3D-Data.

Более 1 млн. изображений и 3,7 млн. верифицированных 3D-аннотаций, охватывающих свыше 13 тыс. категорий объектов. По сценам распределение получилось такое: 52% помещений, 32% городской среды и 15% природы.

Он собран на основе 2D-наборов (COCO, LVIS, Objects365, V3Det): кандидаты в 3D-боксы генерировались 5 независимыми методами оценки геометрии, затем фильтровались, проверялись VLM и дополнительно отбирались людьми.


🟡Статья
🟡Модель
🟡Техотчет
🟡Demo
🖥GitHub


@ai_machinelearning_big_data

#AI #ML #CV #Detection #WildDet3D #Ai2
  • 🤩 78
  • 👏 30
  • 👍 23
  • ❤ 11
  • 🔥 11
  • 🎉 9
  • 🥰 3
More from @ai_machinelearning_big_data
  1. Sep 21, 2026💊 Больше ИИ в больницах - ниже смертность? На графике медицинские учреждения с более акти…
  2. Sep 21, 2026⚡️ StepFun анонсировала флагманскую модель Step 5 Preview Модель построена на архитектуре…
  3. Sep 20, 2026🎨 Qwen открыла веса Qwen-Image-2.1: новой модели для генерации и редактирования изображен…
  4. Sep 20, 2026📌Goldman Sachs повысил прогноз по развитию физического ИИ Финансовый конгломерат обновил…
  5. Sep 19, 2026🌟 Prism ML собрала тернарную версию Qwen3.8-27B Bonsai 2 27B - сжатая Qwen3.8-27B, котора…
  6. Sep 19, 2026Мы уже писали о курсе Дмитрия Баранчука из Школы анализа данных по генеративным моделям в…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →