TransGan: Transformers + GAN
پس از ماجراجویی ترنسفورمرها در مسائل دستهبندی، تشخیص اشیا و قطعهبندی در حوزه پردازش تصویر، حالا بالاخره نوبت به تولید تصویر رسیده است که با ترنسفورمرها آشنا شود. دوستانمون در این مقاله یک مدل تولید تصویر به کل ترنسفورمری و البته چندین آزمایش جالب انجام دادهاند.
نکته قابل توجه در رابطه با معماری قسمت جنریتور این مدل، در اینه که ابتدا با تعداد پچهای کم و با اندازه بالا شروع میکنه و بعد از اعمال هر لایه انکودر ترنسفورمر، تعداد تکهها را دو برابر و البته اندازه اونها را نصف میکنه. در نهایت هم از روی خروجی آخرین انکودر مقادیر rgb پیکسلها را به دست میاره. قسمت دیسکریمینیتور این مقاله هم مشابه همون مقاله ViT است.
اما نکات جالب این مقاله به اختصار:
۱- در مقایسه سه حالت مختلف بین ترکیب جنریتور و دسکریمینتورهای مختلف cnnای یا ترنسفورمری، مقایسه انجام داده و نشون داده که ترکیب جنریتور ترنسفورمری و دیسکریمینتور cnnای بهترین عملکرد را داره.
۲- نکته دوم در وابستگی شدید مدل ترنسفورمری به دیتا آگمنتیشن است که این مقاله نشون داده مدل ترنسفورمری نسبت به مشابه های cnnای خودش به شدت به دیتا اگمنتیشن گشنهتره.
۳-نکته و ابتکار بعدی این مدل اما در ارائه یک تسک سوپررزولوشن کردن تصویر برای قسمت جنریتور است که با مالتی تسک کردن این تسک با تسک تولید تصویر نشون داده که عملکردش بهبود پیدا کرده.
۴-اما ابتکار دیگهاش که بیشتر به چشم ما اومد: همونطور که میدونید معماری ترنسفورمری نسبت به cnn سوگیری القایی (inductive bias) مکانی (locality) را نداره و برای همین حدس زده میشه که در تسک تولید تصویر هم نتونه پیوستگی خوبی بین پیکسل ها و نواحی همسایه به دست بیاره. از همین رو این مدل یک پیشنهاد جالب داشته، به این صورت که در فرآیند آموزش جنریتورش، هر ناحیه ابتدا صرفا به نواحی دور و بر خودش میتونسته attend کنه و بعدش به مرور نواحی بیشتر از ماسک درمیان و به اونها هم میتونه attention داشته باشه. این ایده هم نشون داده شده که تونسته عملکرد مدل را بهبود بده.
(برای دیدن عکسها در گوشی ورق بزنید.)
لینک مقاله:
https://arxiv.org/abs/2102.07074
.
لینک یوتوب توضیح مقاله:
https://www.youtube.com/watch?v=R5DiLFOMZrc
#read
#paper
@nlp_stuff
Post #133
1.23K