ویژن ترنسفورمر معماری Transformer را اینبار اما برای تصاویر تطبیق میدهد.
به جای کلمات، تصویر به قطعات کوچکی (Patch) تقسیم میشود و هر قطعه مانند یک توکن در نظر گرفته میشود.
■جریان پردازش:
Images
↓
Patchها
↓
Patch Embeddings
↓
Positional Embeddings
↓
Global Self-Attention
↓
Transformer Encoder
↓
طبقهبندی (Classification)
⭕️ویژگیها
ورودی: قطعات ثابت تصویر
استفاده از توکن [CLS] برای تصمیم نهایی
توجه سراسری میان تمام Patchها
نمایش تخت (Flat Representation)
معمولاً به داده آموزشی زیاد نیاز دارد
⭕️مزیت اصلی:
هر بخش تصویر میتواند مستقیماً با هر بخش دیگری ارتباط برقرار کند:
Patch-to-Patch Global Attention
↓
هوش بصری سراسری
Global Attention:
🤖در ViT همه Patchهای تصویر میتوانند مستقیماً با یکدیگر تعامل داشته باشند.
◀️مزیت:
یادگیری روابط دوربرد
درک ساختار کلی تصویر
فهم ارتباط اجزای دور از هم
❌عیب:
هزینه محاسباتی زیاد برای تصاویر بزرگ.
#ViT
#GlobalAttention
@toobabigdatascience