TGViewer
Machinelearning Machinelearning @ai_machinelearning_big_data · 279K subscribers
Post #10594 21.3K
🌟 SenseNova-Vision: CV-комбайн в едином генеративном интерфейсе

SenseTime открыла веса единой модели зрения SenseNova-Vision. Обычно под каждую задачу (найти объекты, выделить их контуры, оценить глубину сцены) строят отдельную систему или встраивают в модель специальный модуль. Здесь от этого отказались - все задачи модель решает как генерацию текста, картинки или их смеси.

Компания основана в 2014 году и выросла из университетской лаборатории MMLab - оттуда вышла заметная часть китайских специалистов по компьютерному зрению. Известность пришла в 2015-м, когда алгоритм распознавания лиц SenseTime обошёл по точности человеческий глаз. В 2026 году Gartner назвала компанию визионером в генеративном CV.


🟡Механика

Рамки объектов и распознанный текст модель выдаёт текстом с координатами, карты глубины и нормалей поверхностей - картинками, а сложную сегментацию - смешанным ответом, где текстовая легенда задаёт цвета маски.

Авторы сравнивают подход с тем, что GPT сделал для текста: вместо зоопарка специализированных систем - один генеративный интерфейс.


Под капотом - открытая мультимодальная модель Bagel-7B-MoT от ByteDance, дообученная без изменений архитектуры.

MoT - это смесь трансформеров. Внутри модели живут 2 эксперта с собственными весами - один отвечает за понимание текста и изображений, второй за генерацию картинок, а внимание у них общее, так что оба смотрят на один контекст. Токены распределяются между экспертами жёстко, по типу данных, а не обучаемым маршрутизатором, как в MoE.

Для SenseNova-Vision такое устройство пришлось кстати - модель чередует текстовые ответы вроде координат и картиночные вроде масок, и у каждой ветки свой набор весов.

🟡Тесты

SenseNova-Vision лидирует среди сопоставимых систем там, где ответ - структурированный текст (детекция, в том числе в плотных сценах с десятками объектов, локализация текста на изображении, ключевые точки).

В оценке глубины и нормалей она близка к лучшим генеративным методам, в сегментации держится на уровне конкурентов.

Слабые места тоже есть. В многовидовой 3D-геометрии модель отстаёт от специализированных VGGT и Depth Anything 3, а текст на русском распознаёт заметно хуже, чем на английском.


Вместе с моделью опубликован корпус SN-VC-50M - 50 млн обучающих примеров из открытых наборов: 18,9 млн кадров для структурного понимания, 17,3 млн для плотной геометрии, 12,5 млн для многовидовой геометрии и 1,3 млн для сегментации.


📌Лицензирование: CC-BY-NC-4.0


🟡Модель
🟡Arxiv
🟡Датасет
🟡Демо
🖥GitHub


@ai_machinelearning_big_data

#AI #ML #СV #MoT #SenseNovaVision #SenseTime
  • ❤ 27
  • 👍 15
  • 🔥 10
  • ⚡ 1
  • 🌭 1
More from @ai_machinelearning_big_data
  1. Sep 30, 2026🔥 Google официально представила Gemini 4 Argon Это новая frontier-модель компании для сло…
  2. Sep 30, 2026✔️ Nvidia представила открытую платформу безопасности для агентов Open Agent Safety Platfo…
  3. Sep 30, 2026Осень — время, когда бизнес активно начинает искать подрядчиков: бухгалтеров, юристов, мар…
  4. Sep 30, 2026✔️ Google заменит Gems в Gemini на Skills Личные аккаунты Google перейдут на новый формат…
  5. Sep 30, 2026Разработка модели компьютерного зрения не всегда начинается с кода. Иногда больше времени…
  6. Sep 30, 2026✔️ AMD покупает World Labs Стартап Фей-Фей Ли, который с 2024 года разрабатывает модели пр…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →