TGViewer
Tensorflow(@CVision) Tensorflow(@CVision) @cvision · 15.1K subscribers
Post #4342 4.48K

Forwarded from آموزش LLM و VLM

مدل LocateAnything از NVIDIA؛ حذف یکی از بزرگ‌ترین گلوگاه‌های مدل‌های Vision-Language

مدل جدید LocateAnything انویدیا مشکل کندی مدل‌های تشخیص اشیاء رو با یه ایده ساده و هوشمندانه حل کرده:
Parallel Box Decoding (PBD).

مسئله چی بود؟ مدل‌های VLM معمولاً مختصات هر باکس (x1,y1,x2,y2) رو توکن به توکن و به‌صورت متوالی تولید می‌کنن. وقتی صحنه پر از اشیاء باشه (مثلاً ۱۰۰ آبجکت)، این یعنی هزاران توکن قبل از رسیدن به جواب نهایی! هم کند، هم چون مختصات یک باکس مستقل از هم پیش‌بینی می‌شن، کاهش دقت هندسی.

راه‌حل PBD: کل باکس به‌عنوان یک واحد اتمیک (block) با طول ثابت در یک گام موازی پیش‌بینی می‌شه، نه توکن به توکن. این کار هم‌زمانی همون‌قدر که سرعت رو بالا می‌بره، دقت رو هم بهتر می‌کنه چون چهار مختصه با آگاهی از هم پیش‌بینی می‌شن (نه کور و مستقل).

📄 مقاله:
https://research.nvidia.com/labs/lpr/locate-anything/LocateAnything.pdf

🌐 پروژه:
https://research.nvidia.com/labs/lpr/locate-anything/

💻 دمو :
https://huggingface.co/spaces/nvidia/LocateAnything

🤗مدل:
https://huggingface.co/spaces/nvidia/LocateAnything
  • ❤ 13
  • 🔥 4
  • ❤‍🔥 2
  • 😱 1
More from @cvision
  1. Sep 28, 2026مهلت استفاده تا پایان این هفته است
  2. Sep 20, 2026‏🎯 Jev‏ کجا به درد می‌خورد و کجا نه؟ ‏Jev‏ بیشتر از اینکه جای GPT‏ یا…
  3. Sep 20, 2026‏🧠 Jev از TypeSafe AI‏؛ مدلی که متن نمی‌نویسد، تصمیم می‌گیرد ‏TypeSafe AI روز…
  4. Sep 13, 2026🍂 به مناسبت شروع ماه مهر تا پایان هفته اول مهر، ۴ دوره آموزشی کلاس ویژن را با ۷۰٪ تخفیف م…
  5. Sep 12, 2026دنیایی از منابع برنامه‌نویسی توی این کانال بصورت دسته‌بندی شده با هشتگ بصورت روزانه قرار د…
  6. Sep 12, 2026🤖 می‌خوای Agent بسازی، نه فقط با AI چت کنی؟ تصور کن مدلی داشته باشی که ابزار صدا بزنه، مس…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →