پیکره متنی ناب
پیکره متنی «ناب» دیتای plain فارسیه که حدود ۱۳۰ گیگه و شامل ۲۵۰ میلیون پاراگراف و ۱۵ میلیارد کلمهست که به تازگی منتشر شده. دوستداران زبان فارسی میتونند برای آموزش مدل زبانی ازش استفاده کنند و مدلهایی رو آماده کنند که ملت هم ازش استفاده کنند.
پ.ن. با تشکر از آزمایشگاه دکتر صامتی در دانشگاه شریف که پیکره رو به صورت عمومی منتشر کردند. دعای خیر ما بدرقه راهشان!
لینک مقاله:
https://arxiv.org/abs/2208.13486
لینک هاگینگفیس:
https://huggingface.co/datasets/SLPL/naab
https://huggingface.co/datasets/SLPL/naab-raw
#dataset
@nlp_stuff
Post #302
4.19K