تقاطع Information Retreival و Contrastive Learning
بازیابی اطلاعات و اسناد یکی از تسکهای مهم در حوزه پردازش زبانه. مخصوصا وقتی که پای تسکهایی مثل QA در میون باشه داشتن یک سیستم IR خوب نیاز قطعیه. در سالهای اخیر با توجه به ترکوندن شبکههای عصبی، طبیعتا انگیزههایی پیش اومد تا برای IR هم از راه شبکههای عصبی راه حلی پیدا بشه که منجر به ظهور dense retrieval ها شد. اینها در واقع شبکههای عصبی هستند که با گرفتن یک داکیومنت و یک کوئری، میزان امتیاز ارتباط این زوج رو خروجی میدهند. این شبکههای عصبی با این که در بنچمارکهای IR که براشون دیتاست آموزش وجود داره پرچمدار هستند اما در موقعیتی که بایستی بر روی دامین جدیدی که از اون دیتای آموزشی ندارند (Zero-Shot) تنظیم شوند دچار مشکلند. از اونجایی هم که درست کردن دیتاست برای تسک IR کار بسیار هزینهبر و وقتگیریه عملا راهی برای بانظارت کردن وجود نداره. این مشکل به حدیه که به لحاظ عملکرد پشت سر روشهایی لفظ محوری همچون TF-IDF و BM25 که غیرنظارتی هستند، قرار میگیرند. سوال حالا اینه که آیا ما میتونیم dense retrieveal ای آموزش بدهیم که بدون نیاز به داده آموزشی و نظارت حین آموزش بتونه روشهایی مثل BM25 رو پشت سر بگذاره؟ حالا پیپری اومده جواب داده بله! این پیپر اومده بررسی کرده آیا contrastive learning روی مجموعه داکیومنتهای مورد نظر میتونه پاسخ خوبی باشه یا نه؟ این پیپر تقریبا کار نویی نکرده ولی بررسی جالبی رو انجام داده. برای ساختن زوجهای مثبت موردنیاز contrastive learning اومدند و استراتژیهای سادهای مثل تقسیم متن سند به دو متن یا نمونهبرداری مستقل از متن سند رو انجام دادند. با این تکنیکها تونستن در بنچمارکهای IR و در تنظیمات Zero-Shot تنه به تنه روشهایی مثل BM25 بزنند. سپس اومدند تنظیمات Few-Shot ای رو بررسی کردند که توش چند نمونه کوئری برای اسناد وجود دارند. با فاین تیون کردن روی این نمونههای هرچند اندک تونستند حتی از BM25 جلو بزنند. این پیپر شاید مقدمهای بر استراتژی و ایدههای بیشتری در حوزه تقاطع IR و Contrastive Learning در آینده باشه.
لینک مقاله:
https://arxiv.org/abs/2112.09118
#paper
#read
@nlp_stuff
Post #254
2.38K