خون اول. ParsTwiNER؛ دادگان عمومی توییتر فارسی برای NER از تیم اورفیت
خوشبختانه مقاله ما در ورکشاپ WNUT کنفرانس EMNLP 2021 پذیرفته شد و ارائه شفاهی هم دادیم. این مقاله درباره named entity recognition در فضای فارسی غیررسمیه. در این مقاله یه دادگان خوب هم از توییتر فارسی جمعآوری کردیم و تگ زدیم و حالا اون رو بهصورت عمومی عرضه میکنیم تا اندکی از دین خودمون رو به جامعه فنی ادا کرده باشیم.
کیفیت عملکرد مدل ParsBert رو بر روی دادگانمون بررسی کردیم که افت شدید داشت و به f-score حدود ۶۹ درصد رسیده بود. پس در این مقاله یه راهکاری هم با استفاده از یادگیری موازی و data anealing ارائه دادیم تا عملکرد مدل رو به f-score حدودا ۸۲ درصدی برسونیم. اگر مدل شما نتایج بهتری روی این دیتاست گرفت، پول ریکوئست بدید که به ریپو اضافه کنیم.
قضیه از این قراره که دیتاستهای مشهور فارسی در NER مثل پیما و آرمان، همه برروی فارسی رسمی جمعآوری شدهاند. فضای زبانهای غیررسمی یه محیط نویزیه و به همین دلیل مدلهایی که در فضای رسمی آموزش دیدند، اینجا رو خراب میکنند. در این مقاله یه انکودر برت رو به اشتراک گذاشتیم و برای دو تسک NER در فضای رسمی و غیررسمی دوتا دستهبند جدا بر روی انکودر بهاشتراکگذاشته درنظرگرفتیم. حالا در هر دور یادگیری با احتمال لامدا از دیتاست خودمون به مدل میدیم. در ابتدای یادگیری این نسبت خیلی کوچیکه و بیشتر دادگان از فضای رسمی به مدل داده میشه (مثلا دیتاست پیما) اما رفتهرفته این نسبت بزرگ میشه. علت این کار اینه که ساختار زبان غیررسمی درهمریختگی داره و ممکنه مدل رو در ابتدای یادگیری گیج کنه. به خاطر همین باید ساختارهای اولیه رو از دیتای رسمی یاد بگیره و کمکم وارد فضای غیررسمی بشه. مدلهای آموزشدادهشده هم بر روی هاگینگفیس دردسترس هستند.
پ.ن.۱: خداوکیلی هر پستی رو دستبهدست نمیکنید این رو بکنید که بهدست عاشقان و دلدادگان پردازش زبان طبیعی در فارسی برسه!
پ.ن.۲: و لطفا استار به ریپوی گیتهاب یادتون نره!
لینک مقاله:
https://aclanthology.org/2021.wnut-1.16/
لینک دادگان در گیتهاب:
https://github.com/overfit-ir/parstwiner
لینک مدلها:
https://huggingface.co/overfit/twiner-bert-base-mtl
#dataset
#read
#paper
@nlp_stuff
Post #250
3.64K