■(مخفف Shifted Window Transformer) نسخهای کارآمدتر از ViT است.
به جای اینکه هر Patch با همه Patchهای دیگر ارتباط داشته باشد، توجه فقط در پنجرههای محلی انجام میشود.
🔁جریان پردازش
Images
↓
Patchها
↓
Window Attention
↓
Shifted Window Attention
↓
Patch Merging
↓
ویژگیهای سلسلهمراتبی
↓
طبقهبندی / تشخیص / بخشبندی
♾ توجه محلی (Local Attention) در مقابل توجه سراسری (Global Attention)
در Swin هر Patch فقط به Patchهای داخل پنجره خود توجه میکند.
☑️مزیت:
محاسبات بسیار کمتر
مناسب برای تصاویر با رزولوشن بالا
Shifted Window Attention
نوآوری اصلی Swin همین بخش است.
🔘در یک بلوک:
□ □
□ □
🔘و در بلوک بعدی پنجرهها جابهجا میشوند:
□ □
□ □
⬅️چه فایدهای دارد این جابجایی پنجرهها؟
◀️اطلاعات بین پنجرههای مجاور منتقل میشود.
◀️محدودیت توجه محلی از بین میرود.
◀️مدل میتواند به تدریج روابط گستردهتری را یاد بگیرد.
👁🗨کاربرد در بینایی ماشین:
🔘طبقهبندی تصویر (Image Classification)
هر دو معماری:
ViT
Swin
در طبقهبندی تصاویر عملکرد بسیار خوبی دارند.
در حالی که Transformer اصلی بیشتر برای دادههای ترتیبی طراحی شده است.
🔄نکته طراحی الگوریتمی(پیچیدگی چیمیشه؟)
ترنسفورمر و ViT دارای پیچیدگی زمانی از مرتبه ی
O(n^2)
و Swin تقریبا از مرتبه خطی ست.
♻️وظایف چگال بینایی (Dense Vision Tasks)
مانند:
🔘تشخیص اشیاء (Object Detection)
🔘بخشبندی تصویر (Image Segmentation)
Swin 🔻
معمولاً مناسبتر است زیرا:
•ویژگیهای چندمقیاسی تولید میکند.
•ساختار سلسلهمراتبی دارد.
•مشابه Feature Pyramid در CNNها عمل میکند.
🩻کاربرد در تصویربرداری پزشکی با
ViT
چون در یادگیری روابط گسترده آناتومیکی قوی است.
مثلاً:
ارتباط بین دو ناحیه دور از هم در MRI
تحلیل ساختار کلی اندامها
البته از Swin هم می توان استفاده کرد
چون همزمان میتواند:
●جزئیات محلی را حفظ کند.
●اطلاعات زمینهای بزرگتر را به تدریج ترکیب کند.
بنابراین هر دو در تحقیقات پزشکی بسیار مورد استفاده قرار گرفتهاند.
.......ادامه دارد
#Swin
#Transformers
@toobabigdatascience