مدل SenseNova-Vision-7B-MoT از تیم SenseNova
برخلاف VLMهای معمول (مثل Qwen-VL) که فقط تصویر میگیرن و متن تولید میکنن، این مدل هم متن تولید میکنه هم تصویر — یعنی میتونه خروجیهایی مثل نقشه عمق، ماسک سگمنتیشن یا نقشه نقاط سهبعدی رو مستقیماً و بدون هد اختصاصی برای هر تسک بسازه
- تشخیص اشیا، لوکالیزیشن، OCR، گراندینگ رابط کاربری، کیپوینت
- تخمین عمق و نرمال سطح
- سگمنتیشن (رفرنسی، استدلالی، تعاملی، GCG)
- بازسازی هندسه چندنمایی و تخمین پوز دوربین
📊 عملکرد:
در مقایسه با Qwen3-VL-8B-Instruct، در اکثر تسکهای تشخیص و لوکالیزیشن جلوتره؛ مثلاً OCR (ICDAR15): ۴۹.۵ در برابر ۲۵.۴، و RefCOCOg: ~80 در برابر ~72.
البته در مقابل، توی درک عمومی تصویر (MMMU) با نمره ۰.۴۲ از Bagel (۰.۵۵) عقبتره — یعنی این مدل تخصصیِ کارهای ساختاریافته بیناییست، نه مکالمه و استدلال عمومی.
🔗 مدل در هاگینگ فیس
🔗 گیتهاب
📄 مقاله
___
@llm_huggingface
@cvision
Post #4345
3.23K
