نوتبوک back-translation با قابلیت هرس
در خیلی از موقعیتها، شما با یک دیتاست با حجم کمی رو به رو هستید و قادر به اضافه کردن حجمش نیستید. طبیعتا آموزش مدل روی دیتاست کوچک نتیجه خوبی به همراه نداره و مجبور به Data Augmentation هستید. یکی از شیوههای Data Augmentation در دادههای متنی استفاده از back-translation است (متنهایی که دارید رو مثلا از فارسی میبرید به انگلیسی و دوباره از انگلیسی برمیگردونید به فارسی، حالا شما متنهای متفاوت ولی هم معنی دارید) یکی از مشکلات این روش میتونه این باشه که متن تولید شدهای که به دست میاد ممکنه کلا تو دیوار باشه و ارتباطی به متن اولیه نداشته باشه. دوستمون آقای سجاد ایوبی، اومدن و یک نوتبوک برای back-translation با استفاده از گوگل ترنسلیت نوشتند و برای استفاده شما در اختیار قرار دادند. یک نکته خوبی که این کد ارائه شده ایشون داره اینه که پس از آگمنت کردن متن دوم، اون رو با استفاده از مدلهای sentence embedding با جمله اول مقایسه میکنه و در صورتی که میزان شباهت معنایی این دو متن کمتر از حد آستانه خاصی بود، متن دوم رو به عنوان نویز در نظر میگیره و به خروجی نمیده.
لینک:
https://www.kaggle.com/sajjadayobi360/filtred-back-translation
پ.ن. ریپو یا کد بهدردبخوری داشتید، ندا بدید که بعد از بررسی در کانال قرار بدیم.
#code
@nlp_stuff
Post #207
1.99K