ماجراجوییهای جذاب با contrastive learning اینبار در speech!
تیم تحقیقاتی فیسبوک در ادامه روند رو به رشدش در speech اینبار پای contrastive learning رو وسط کشیده تا بازی speech رو کلا عوض کنه!! شاید باورتون نشه ولی کل تسک بازشناسی رو تقسیم به فاز pre train و fine tuning کرده (که همین هم باعث شده خودش رو در دل هاگینگفیس جا کنه و هاگینگفیس به طور رسمی ازش پشتیبانی میکنه!) در فاز pre training مثل مدل زبانی میاد و سعی میکنه مدل صوتی درست کنه و در واقع به نوعی بازنمایی سگمنتهای مختلف صوتی رو با یه contrastive loss یاد میگیره که این کار کاملا self supervised است و نیازی به لیبل نداره؛ حالا در فاز fine tuning میاد و با صوتهای لیبل خورده یه شبکه ساده خطی که با تابع هدف CTC ترین میشه کار رو تکمیل میکنه. نتیجه خارق العادهست! تنها با ۱۰ دقیقه صوت لیبلدار نتایجی نزدیک به state of the artهای قبلی رو در این حوزه تولید میکنه؛ یعنی WER (word error rate) حدود ۴ درصد برای صوت تمیز و حدود ۸ درصد برای صوتهای واقعی! معماری بخش contrastive lossش هم ترنسفورمری است و برای تبدیل صوت خام به وکتور از لایه کانولوشنی استفاده میکنه.
بهونه کمبود داده لیبل خورده نیارید که contrastive learning قراره بازی رو در بیاره!
لینک مقاله:
https://arxiv.org/pdf/2006.11477.pdf
لینک هاگینگ فیس:
https://huggingface.co/facebook/wav2vec2-base-960h
#read
#paper
Post #135
1.32K