TGViewer
NLP stuff NLP stuff @nlp_stuff · 3.86K subscribers
Post #250 3.64K
خون اول. ParsTwiNER؛ دادگان عمومی توییتر فارسی برای NER از تیم اورفیت

خوشبختانه مقاله ما در ورکشاپ WNUT کنفرانس EMNLP 2021 پذیرفته شد و ارائه شفاهی هم دادیم. این مقاله درباره named entity recognition در فضای فارسی غیررسمیه. در این مقاله یه دادگان خوب هم از توییتر فارسی جمع‌آوری کردیم و تگ زدیم و حالا اون رو به‌صورت عمومی عرضه می‌کنیم تا اندکی از دین خودمون رو به جامعه فنی ادا کرده باشیم.

کیفیت عملکرد مدل ParsBert رو بر روی دادگان‌مون بررسی کردیم که افت شدید داشت و به f-score حدود ۶۹ درصد رسیده بود. پس در این مقاله یه راهکاری هم با استفاده از یادگیری موازی و data anealing ارائه دادیم تا عملکرد مدل رو به f-score حدودا ۸۲ درصدی برسونیم. اگر مدل شما نتایج بهتری روی این دیتاست گرفت، پول ریکوئست بدید که به ریپو اضافه کنیم.

قضیه از این قراره که دیتاست‌های مشهور فارسی در NER مثل پیما و آرمان، همه برروی فارسی رسمی جمع‌آوری شده‌اند. فضای زبان‌های غیررسمی یه محیط نویزیه و به همین دلیل مدل‌هایی که در فضای رسمی آموزش دیدند، اینجا رو خراب می‌کنند. در این مقاله یه انکودر برت رو به اشتراک گذاشتیم و برای دو تسک NER در فضای رسمی و غیررسمی دوتا دسته‌بند جدا بر روی انکودر به‌اشتراک‌گذاشته درنظرگرفتیم. حالا در هر دور یادگیری با احتمال لامدا از دیتاست خودمون به مدل میدیم. در ابتدای یادگیری این نسبت خیلی کوچیکه و بیشتر دادگان از فضای رسمی به مدل داده می‌شه (مثلا دیتاست پیما) اما رفته‌رفته این نسبت بزرگ می‌شه. علت این کار اینه که ساختار زبان غیررسمی درهم‌ریختگی داره و ممکنه مدل رو در ابتدای یادگیری گیج کنه. به خاطر همین باید ساختارهای اولیه رو از دیتای رسمی یاد بگیره و کم‌کم وارد فضای غیررسمی بشه. مدل‌های آموزش‌داده‌شده هم بر روی هاگینگ‌فیس دردسترس هستند.

پ.ن.۱: خداوکیلی هر پستی رو دست‌به‌دست نمی‌کنید این رو بکنید که به‌دست عاشقان و دلدادگان پردازش زبان طبیعی در فارسی برسه!

پ.ن.۲: و لطفا استار به ریپوی گیت‌هاب یادتون نره!

لینک مقاله:
https://aclanthology.org/2021.wnut-1.16/

لینک دادگان در گیت‌هاب:
https://github.com/overfit-ir/parstwiner

لینک مدل‌ها:
https://huggingface.co/overfit/twiner-bert-base-mtl

#dataset
#read
#paper

@nlp_stuff
Telegram stuff
More from @nlp_stuff
  1. Jan 6, 2026اندر حکایات بازی با کلمات: AI Engineering vs ML Engineering/Data Scientist این روزها عناوی…
  2. Mar 3, 2025مفهوم Agent چیست و چگونه کار می‌کنند؟ خانم چیپ هوین بلاگ پست مفصلی راجع به Agent (به قول ر…
  3. Feb 28, 2025خلاصه‌تر فکر کن از اونجایی که در مسائل استدلالی (reasoning) ، مدل برای رسیدن به جواب نهایی…
  4. Feb 23, 2025چه قدر تا بی‌کارشدن بک‌اندی‌ها فاصله داریم؟ عمده استفاده برنامه‌نویس‌ها از LLM‌ها در سطح پ…
  5. Feb 20, 2025به سوی سیستم‌۲ پیشرفت‌های هوش مصنوعی در دهه ۲۰۱۰، مدیون آموزش مدل‌های بزرگ دیپ لرنینگی روی…
  6. Feb 8, 2025مدل‌های استدلالی (reasoning) چیست و چگونه ساخته می‌شوند؟ حتما این روزها بارها مدل‌های استد…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →