مدل LocateAnything از NVIDIA؛ حذف یکی از بزرگترین گلوگاههای مدلهای Vision-Language
مدل جدید LocateAnything انویدیا مشکل کندی مدلهای تشخیص اشیاء رو با یه ایده ساده و هوشمندانه حل کرده:
Parallel Box Decoding (PBD).
مسئله چی بود؟ مدلهای VLM معمولاً مختصات هر باکس (x1,y1,x2,y2) رو توکن به توکن و بهصورت متوالی تولید میکنن. وقتی صحنه پر از اشیاء باشه (مثلاً ۱۰۰ آبجکت)، این یعنی هزاران توکن قبل از رسیدن به جواب نهایی! هم کند، هم چون مختصات یک باکس مستقل از هم پیشبینی میشن، کاهش دقت هندسی.
راهحل PBD: کل باکس بهعنوان یک واحد اتمیک (block) با طول ثابت در یک گام موازی پیشبینی میشه، نه توکن به توکن. این کار همزمانی همونقدر که سرعت رو بالا میبره، دقت رو هم بهتر میکنه چون چهار مختصه با آگاهی از هم پیشبینی میشن (نه کور و مستقل).
📄 مقاله:
https://research.nvidia.com/labs/lpr/locate-anything/LocateAnything.pdf
🌐 پروژه:
https://research.nvidia.com/labs/lpr/locate-anything/
💻 دمو :
https://huggingface.co/spaces/nvidia/LocateAnything
🤗مدل:
https://huggingface.co/spaces/nvidia/LocateAnything
Post #4342
4.48K