عیدی صوتی فیسبوک به همه زبانها
خب مندلکبازی و تبریک سال نو بسه، بریم سراغ کار اصلیمون: چند وقت پیش در کانال درباره wav2vec2 پستی (این پست https://t.me/nlp_stuff/135) گذاشتیم. نکتهش این بود که مدل pre-train/fine-tune که قبل از این، در حوزه NLP سربلند بیرون اومده بود حالا وارد عرصه speech شده. شما باید اول یه مدل pre-train شده رو که به صورت بدون نظارت است در یک زبان آموزش داده باشید و بعد با اندک دیتای برچسبخورده در تسک موردنظرتون (مثلا بازشناسی گفتار) بر اون تسک فائق بیاید! حالا دوستان Facebook AI گفتند که شاید برخی زبانها حتی همون دیتای بدون برچسب در حجم زیاد رو هم نداشته باشند و یا اینکه منابع لازم برای آموزش مدل pre-train رو در اختیار نداشته باشند، به خاطر همین مدل cross lingual همین wav2vec رو ارائه دادند که در واقع از شر pre-train رها میشید و فقط به دنبال fine tune کردن روی تسک مورد نظرتون تمرکز میکنید. نتیجه اینکه هاگینگ فیس هم کلی ذوق کرد و ملت رو بسیج کرد تا با امکاناتی که فراهم کرده این مدل cross lingual رو برای زبان محلی خودشون فاین تیون کنند. حالا آقای مهرداد فراهانی برای زبان فارسی، بار امانت رو به دوش کشید. طبیعتا از یه مدل cross lingual نباید توقع داشت که state of the artهای زبان رو جا به جا کنه ولی به نرخ خطای ۳۲ درصد بر اساس معیار WER رسیده که خوبه. توجه کنید که اندک کارهای قبلی در حوزه ASR فارسی نرخ خطاهایی در حدود ۲۰ الی ۲۸ درصد داشتند (البته سناریوهای تست با توجه به نویزی بودن و یا تمیز بودن صوت و مدل سازی صوت متفاوته)! اگر جایی گیر کردید و ASR لازم بودید، میتونید از این مدل استفاده کنید یا حتی روی دیتاست شخصیتون اون رو فاین تیون کنید و غمتون نباشه دیگه.
لینک مقاله cross-lingual:
https://arxiv.org/abs/2006.13979
لینک راهنمای فاینتیون کردن:
https://huggingface.co/blog/fine-tune-xlsr-wav2vec2
لینک مدل فاینتیون شده فارسی:
https://huggingface.co/m3hrdadfi/wav2vec2-large-xlsr-persian
#read
#paper
#link
@nlp_stuff
Post #152
1.52K