نوتبوک داینامیک پدینگ
یکی از تفاوتهای اساسی دادههای متنی با دادههای تصویری، سایز مختلف نمونههای متنی (طول متن) نسبت به یکدیگره. برای حل این معضل راهکار padding استفاده میشه که در آن، طول تمامی نمونههای یک بچ یکسانسازی میشه. سادهترین استراتژی در این راستا میتونه این باشه که همه متنها رو به اندازه طول بزرگترین متن پد کنیم، اما خب واضحه که با این کار وقت و منابع زیادی رو برای بچ هایی که طول طولانیترین متنشون به اندازه طولانیترین متن کل دادهها نیست، هدر میدهیم. استراتژی موثرتر میتونه استفاده از داینامیک پدینگ باشه که تو این روش دادهها رو فقط به اندازه طولانیترین متن حاضر در هر بچ پد کنیم. باز هم اینجا ممکنه یک متن طولانی با یک متن کوتاه با هم در یک بچ حاضر بشوند و منابع زیادی برای پد کردن این بچ به هدر بره. راهکارهای دیگه مثل سورت کردن یا شبه سورت کردن دادهها برای حل این مشکل وجود دارند. آقای ایوبی اومدند و در راستای این دسته روشهای مطرح شده نوتبوکی رو آماده کردهاند و در اختیار بقیه قرار دادند. این نوتبوک شامل کدهای مربوط به انجام هر یک از این روشهاست و البته توضیحشون و مزایا و معایبشون هم قرار داده شده. میتونید مشاهده کنید و در صورت نیاز در کدهاتون استفاده کنید.
لینک نوتبوک:
https://sajjjadayobi.github.io/blog/tips/2021/08/09/sortish-bathes.html
پ.ن. با تشکر از آقای ایوبی بابت فرستادن این پست. شما نیز اگر مطلب یا محتوای جالبی در دست دارید، بفرستید تا با اسم خودتون در کانال قرار داده بشه.
#code
@nlp_stuff
Post #228
2.02K