بهترینهای کنفرانس EMNLP2021
بهترین مقالههای (کوتاه، بلند و برجسته) کنفرانس EMNLP2021 انتخاب شدند. اینجا لینک مربوط به هر مقاله و خلاصهی سرپایی چندخطیشون رو آوردیم. ما کمکم سراغشون میریم ولی اگر شما هم هر کدوم رو خوندید و خلاصهی کاملتری نوشتید، بفرستید تا به اسم خودتون منتشرش میکنیم.
لینک اسامی و نویسندههای مقالات منتخب:
https://2021.emnlp.org/blog/2021-10-29-best-paper-awards
۱. بهترین مقالهی بلند
- نام مقاله: Visually Grounded Reasoning across Languages and Cultures
- خلاصه: یک روشی ارائه کردند تا دیتاست ترکیبی عکس و متن استایل ImageNet بشه ساخت اما برای زبانها و فرهنگهای مختلف و نه فقط طبق زبان و فرهنگ آمریکای شمالی و اروپای غربی. و یه دیتاست چندزبانه تصویر و متن به نام Multicultural Reasoning over Vision and Language (MaRVL) درست کردند که هر دونه از اعضای این دیتاست به شکل دو تصویر + یک متن توصیفی به زبانهای متنوع و مختلفی مثل اندونزیایی، چینی، ترکی و… است و برچسبش True/False است. نمونهای ازش در ضمیمه اومده. یه سری مدل هم به عنوان مدلهای پایه برای این تسک ارائه کردند.
- لینک مقاله:
https://arxiv.org/abs/2109.13238
۲. بهترین مقالهی کوتاه
- نام مقاله: CHoRa: Collecting Humor Reaction Labels from Millions of Social Media Users
- خلاصه: همونجوری که از اسمش مشخصه، یه روشی و چهارچوبی ارائه کردند تا شوخیهای ملت رو بتونند در ابعاد بزرگ از شبکههای اجتماعی بدون برچسبزنی دستی و با استفاده از عکسالعمل بقیهی کاربران (ایموجی و اینا) جمعآوری کنند. چون هر زبون و فرهنگی مدل شوخیهای خودشو داره، جمعآوری دیتا در ابعاد بزرگ سخته، پس تبعا و طبعا؛ تسکش هم سخت میشه. این مقاله یک دیتاست عظیم ۷۸۵هزارتایی حول موضوع کرونا ارائه کردند و تحلیلهایی هم از ساختار گرامری و معنایی و احساسی این پستها انجام دادند. تصویری از نمونه دادگان ضمیمه شده است.
- لینک ارائه مقاله:
https://underline.io/lecture/37879-choral-collecting-humor-reaction-labels-from-millions-of-social-media-users
۳. مقالههای برجسته
- نام مقاله: MindCraft: Theory of Mind Modeling for Situated Dialogue in Collaborative Tasks
- لینک مقاله:
https://arxiv.org/abs/2109.06275
- نام مقاله: SituatedQA: Incorporating Extra-Linguistic Contexts into QA
- خلاصه: سوالها ممکنه جوابشون در مکانها و زمانهای (context) مختلف متفاوت باشه. مثلا سوال چه واکسنهای کرونایی برای بزرگسالان تایید شده است؟ برای زمانها و و مکانهای مختلف متفاوت میشه. این مقاله همونطور که از اسمش پیداست، یه دیتاست به اسم SITUATEDQA تقدیم جامعه کردند که کنار سوال، یه کانتست زمان یا مکان هم چاشنی کار کردند که مدل باید در نظر بگیره. یه عکس از نمونهاش در ضمیمه گذاشتیم. مسیر جمعآوری و برچسبزنی داده رو هم آوردند.
- لینک مقاله:
https://arxiv.org/abs/2109.06157
- نام مقاله: When Attention Meets Fast Recurrence: Training Language Models with Reduced Compute
- خلاصه: در جریان هزینههای بالای محاسباتی آموزش مدلهای زبانی بزرگ هستید دیگه؟ این مقاله اومده مدل زبانی رو با یه سری یونیت بازگشتی ترکیب کرده و با ترنسفورمرهایی مثل Trans-XL و Longformer و Shortformer مقایسه کردند و در حالی که هزینهها را یک سوم تا یک دهم کرده، تونسته در بعضی تسکها بر مدلهای زبانی مذکور فائق بیاد.
- لینک مقاله:
https://arxiv.org/abs/2102.12459
- نام مقاله: Shortcutted Commonsense: Data Spuriousness in Deep Learning of Commonsense Reasoning
- لینک کد مقاله:
https://github.com/nlx-group/Shortcutted-Commonsense-Reasoning
۴. کتابخونهی dataset هاگینگفیس هم جایزهی بهترین مقالهی demo رو برده.
پ.ن. لطفا کانال را به بقیه هم معرفی کنید.
#read
#paper
#conf
@nlp_stuff
Post #243
2.45K