یادگیری بازنمایی مشترک تصویر-متن!
در طی سالیان اخیر، مدلهای از پیشآموزش دیده نظیر برت و یا Resnet کاربردهای فراوانی در یادگیری ژرف داشتند. رسالت این مدلها اینه که با گرفتن یک ورودی (برای برت متن و برای resnet تصویر) یک بردار را به عنوان بازنمایی اون ورودی در خروجی تحویل بدن. هفته پیش مقالهای منتشر شده که سعی کرده این عمل کد کردن را در یک فضای مشترک انجام بده. به بیان بهتر کاری کنه که شما چه تصویر بهش ورودی بدی و چه متن، بیاد یک بازنمایی را در یک فضای مشترک بین تصویر و متن برگردونه. برای مثال وقتی بهش عکس گربه با کاموا میدید و وقتی بهش متن «گربه مشغول بازی با کاموا» بهش میدید، رپرزنتیشنهایی را براتون برگردونه که از لحاظ برداری بهم نزدیک باشند و در واقع متعلق به یک فضای مشترک هستند. مشابه این کار قبلا در مقالههای دیگه مثل CLIP انجام شده، اما تفاوت این مقاله فعلی با CLIP در اینه که بر خلاف CLIP از دیتای تمیزنشده و نویزی زوج تصویر و متنهای کپشن استفاده کرده که طبیعتا با این آسونگیری در فیلتر دادههاش، حجم دیتاستش بسیار زیاد شده. روش آموزشش هم به طور خلاصه به این صورت بوده تصویر و متن مربوط رو به معماریهای EfficientNet و Bert داده و بعدش با ایده Self-Supervised Learning سعی کرده رپرزنتیشنهای حاصل از این دو معماری برای این زوج مربوط رو به هم نزدیک کنه.
نکته جالب مقاله اما در آزمایشها و خروجیهاییه که انتشار داده. در یک آزمایشش سعی کرده تسک بازیابی تصویر (با توجه به یک متن ورودی)را انجام بده و در آزمایش جالب دیگهاش هم سعی کرده با جمع یا تفریق کردن رپرزنتیشن یک کلمه روی رپرزنتیشن یک تصویر، نشون بده که تصویرش (تصویر معادل رپرزنتیشن حاصلشده) چه تغییری میکنه. دو تا تصاویر برای این دو تا آزمایش ضمیمه شدند (برای دیدن جفتش در گوشی ورق بزنید!!).
خواندن این مقاله برای اونهایی که علاقه مند به حوزه Multi-Modal هستند، خالی از لطف نیست.
لینک مقاله:
https://arxiv.org/abs/2102.05918
.
پ.ن. اگر نمیدونید مدل CLIP چیه، پست https://t.me/nlp_stuff/121 را ببینید.
#read
#paper
@nlp_sutuff
Post #131
1.29K