کتابخانه wordfreq
امشب میخوایم یک کتابخونه کوچیک رو بهتون معرفی کنیم. در خیلی از کاربردها و مسائل واقعی به علت پیچیدگی و هزینههای بالای شبکههای دیپ و یادگیری انتها به انتها امکان استفاده ازشون نیست؛ در نتیجه مجبوریم که به سمت روشهای سنتی و در نتیجه استخراج ویژگی از متن و کلمه پیش بریم. یکی از ویژگیهای مهم هر کلمه میتونه فراوانی استفاده ازش در پیکرههای (corpus) مختلف باشه که این معیار میتونه نشون بده که این کلمه چه قدر رایجه، چه قدر ایستواژهست (stopword) یا چه قدر خاصه. در صورتی که خودتون بخواید برای هر کلمه بیاید این عدد رو حساب کنید نیازمند این هستید که یک پیکره بزرگ پیدا کنید و فراوانی هر کلمه از اون رو محاسبه کنید که خب فرآیند وقتگیر و رمگیری میتونه باشه.
کتابخونهی wordfreq برای ۳۶ زبان مختلف (از جمله زبان فارسی) فراوانی نسبی کلمات رو روی پیکرههای متنی بزرگ هر زبان (مثلا برای فارسی روی Wikipedia و Subtitles و OSCAR و Twitter) حساب کرده و به راحتی آب خوردن و به سرعت اراده کردن، برای هر کلمهای که بخواید این مقدار رو بهتون برمیگردونه.
لینک کتابخونه:
https://github.com/LuminosoInsight/wordfreq/
#tool
@nlp_stuff
Post #164
1.57K