TGViewer
متخصصان علم داده ها data scientists متخصصان علم داده ها data scientists @toobabigdatascience · 1.43K subscribers
Post #3096 85
متخصصان علم داده ها data scientists IMG_20260831_142739_531.jpg
Vision Transformer (ViT)
ویژن ترنسفورمر معماری Transformer را اینبار اما برای تصاویر تطبیق می‌دهد.
به جای کلمات، تصویر به قطعات کوچکی (Patch) تقسیم می‌شود و هر قطعه مانند یک توکن در نظر گرفته می‌شود.

■جریان پردازش:

Images
↓
Patchها
↓
Patch Embeddings
↓
Positional Embeddings
↓
Global Self-Attention
↓
Transformer Encoder
↓
طبقه‌بندی (Classification)


⭕️ویژگی‌ها
ورودی: قطعات ثابت تصویر
استفاده از توکن [CLS] برای تصمیم نهایی
توجه سراسری میان تمام Patchها
نمایش تخت (Flat Representation)
معمولاً به داده آموزشی زیاد نیاز دارد

⭕️مزیت اصلی:
هر بخش تصویر می‌تواند مستقیماً با هر بخش دیگری ارتباط برقرار کند:

Patch-to-Patch Global Attention
↓
هوش بصری سراسری



Global Attention:

🤖در ViT همه Patchهای تصویر می‌توانند مستقیماً با یکدیگر تعامل داشته باشند.
◀️مزیت:
یادگیری روابط دوربرد
درک ساختار کلی تصویر
فهم ارتباط اجزای دور از هم
❌عیب:
هزینه محاسباتی زیاد برای تصاویر بزرگ.

#ViT
#GlobalAttention
@toobabigdatascience
  • 👏 3
More from @toobabigdatascience
  1. Oct 8, 2026🤓در‌باره #هوش‌مصنوعی: واقعا امنه! ببینید ما حتی کلید خاموش کردن براش در نظر گرفتیم که اگر…
  2. Oct 7, 2026🔥 گزارش نشریه #آتلانتیک:" کاخ سفید از پنتاگون خواسته است گزینه‌هایی برای ازسرگیری حملات ب…
  3. Oct 7, 2026🦾کی زورش بیشتره؟ 💸مثل همیشه: اونی که پولش بیشتره #Anthropic #AI @toobabigdatascience
  4. Oct 7, 2026🫪واژه‌های مصوب رمزشناسی(ویرایش شهریورماه 1405)، با افزودن ۵۲ واژه مصوب جدید به همراه ویرا…
  5. Oct 7, 2026🔥یکی از جوامعی در جهان، که کودکانشان سوخته‌اند زیر تشعشعات بمب‌های هسته‌ای، ژاپنی‌ها هستن…
  6. Oct 7, 2026متخصصان علم داده ها data scientists pinned a file
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →