و همچنان اندر جادوی CLIP
مطلب جالبی راجع به مدل کلیپ (https://t.me/nlp_stuff/114) اینه که در حین آموزش یک سری تسک تصویری دیگه مثل OCR و Action Recognition را هم به صورت zero shot یاد گرفته.
قبلا مدلهای جیپیتی هم در مورد تسکهای زبانی همینطور بودند.
برای مثال در بخش ۶ (Limitations) مقالهشون اومدند گفتند که ما هیچ تصویری از MNIST در دیتامون نداشتیم ولی تونستیم به صورت zero shot دقت ۸۸ (که البته دقت خوبی نیست) را روی این دیتاست بدست بیاریم!
در این لینک میتونید تصویر دلخواهتون را به صورت zero shot دستهبندی کنید:
https://clip.kiri.ai
اینم لینک مقالهاش:
https://cdn.openai.com/papers/Learning_Transferable_Visual_Models_From_Natural_Language_Supervision.pdf
#read
#paper
@nlp_stuff
Post #121
1.29K

