سلطان PaLI به دنیای تصویر-متن سلام میکند!
بارها گفتیم که دوره یکهتازی مدلهای multimodal شروع شده. این اواخر نیز ظهور مدلهایی مانند Stable Diffusion توجه همه رو به این حوزه دوباره جلب کرد. حالا گوگل با فهم درست شرایط حساس کنونی، یک مدل general purpose برای این حوزه ارایه داده که باهاش تقریبا هر تسک تصویر-متنی رو میتونید انجام بدید و حتی به این بسنده نکرده و مدل رو به صورت multilingual آموزش داده (که فارسی هم ساپورت میکنه). معماری مدل خیلی ساده است و در شکل هم میتونید ببینید که یک vision transformer داره که طبیعتا کار فهم تصویر رو انجام میده و برای فهم متن هم از مدل T5 استفاده میکنه که همونطور که میدونید مدل زبانی هست که تمامی مسایل حوزه پردازش زبان رو به صورت text-to-text مدل میکنه و عملا قابلیت general purpose بودن PaLI رو فراهم میکنه. این مدل هم مانند مدلهای خفن اخیر یه کامیون پارامتر داره که حدود ۱۷ میلیارده که از این مقدار حدود ۴ میلیارد سهم مدل فهم تصویر و ۱۳ میلیارد سهم مدل فهم زبانی هستش! همچنین برای خلق این همه جلال، دست به جمعآوری یک دیتاست بسیار عظیم زدند که اسمش رو WebLI گذاشتند و حدود ۱۰ میلیارد زوج تصویر-متن به زبانهای مختلف داره (حقیقتا با این همه تلاش و توسعه کلا مفهوم میلیارد رو به سخره گرفتند). نکته قابل توجه اینه که این مدل در برخی از بنچمارکهای حوزه تصویر-متن مانند COCO-captions، TextCaps و VQAv2 تونسته رکورد بزنه و مدلهای دیگه رو شکست بده. البته اگه نمیتونید مدل ۱۷ میلیارد پارامتریش رو لود کنید نگران نباشید چون نسخههای کوچکتر هم بیرون دادند که حدود ۳ میلیارد پارامتر داره و با توجه به شرایط فعلی باز هم نمیتونید اون مدل رو لود کنید :)) پس فقط نگاه کنید و لذت ببرید.
لینک بلاگ:
https://ai.googleblog.com/2022/09/pali-scaling-language-image-learning-in.html
#read
#blog
@nlp_stuff
Post #307
4.35K