گلابگیری از دیتاست!
یادگیری عمیق سهم زیادی از پیشرفت خودش رو مدیون دیتاستهای بزرگه. با این وجود، آموزش روی این دیتاستهای بزرگ هزینه محاسباتی و زمانی زیادی رو تحمیل میکنه. کنار این عقبه ذهنی، بحث روشهای یادگیری نمونهمحور و کرنل رو هم در نظر داشته باشید که از هر کلاس چند نمونه رو به عنوان مجموعه ساپورت در نظر میگیرند و برای هر نمونه جدیدی با کمک این نمونههای ساپورت پیشبینی میکنند. هر دوی این مطالب اهمیت کاهش سایز دیتاست رو نشون میده.
سادهترین نگاه میتونه این باشه که چند تا نمونه از دیتاست رو انتخاب کنیم و نگهداری کنیم که اما در عمل نشون داده فعلا موثر نیست و به قدر کافی اطلاعات نگهداری نمیکنند (هیچ چند تا گاوی نیستند که راجع به همه گاوهای دنیا بتونن اطلاعات بدهند). اینجاست که تکنیکی به نام Dataset Distillation وارد بازی میشه (به احتمال زیاد کلمه Distillation رو در موضوع شبکههای عصبی شنیدید اما اگر نشنیدید به طور خلاصه اینه که یک مدل کوچکتر رو به نحوی آموزش میدیم که بتونه عصاره دانش مدل بزرگتر رو یاد بگیره و مثل اون رفتار کنه) اینجا ما به دنبال یادگیری دیتاست ساختگی کوچک از یک دیتاست اصلی بزرگ هستیم که یادگیری مدل روی دیتاست کوچیک مشابه یادگیری مدل روی دیتاست بزرگ تموم بشه. به صورت کلی یادگیری این دیتاست کوچک میتونه مستلزم به محاسبه گرادیان مرتبه دوم بشه که چغر و بدبدنه.
در چند ماه اخیر چندین روش Dataset Distillation اومدند که از زوایای مختلف سعی در رخنه به این مساله داشتند، یکی از این زوایا استفاده از کرنله. در اولین مقاله مورد بحثمون، اومدند و مساله رو به صورت Kernel Ridge Regression مدل کردند به صورتی که شما یک کرنل پیشفرضی دارید و دیتاست کوچیک نمونههای آموزشی و دیتاست بزرگ نمونههای تستی هستند و بایستی مدل KRR آموزش یافته روی دیتاست کوچک میزان لاسش بر دیتاست بزرگ کمینه بشه. از اینجا روابطش بر حسب نمونههای دیتاست کوچک به دست میاد و اونها رو به همراه لیبلهاشون میشه یادگرفت (اسم کل این الگوریتم رو هم گذاشتن KIP و LS).
حالا چند ماه بعد از این مقاله، مقاله دیگهای اومده و با توجه به قضایای مطرح شده Neural Tangent Kernel که بیان میکنه هر شبکه بسیار عریضی (شبکهای که تعداد نورونهاش در لایه به بینهایت میل میکنه) رو میشه به یک کرنل مپ کرد سعی کرده قضیه رو جلو ببره (این NTK خودش دنیای جداییه که اگر درد بیدردی دارید میتونید بخونیدش). پس در ادامه یک شبکه کانولوشنی چندلایه رو فرض کردند و با فرض عریض بودنش کرنلش رو استخراج کردند سپس با روش مقاله قبلی دیتاست کوچک رو یاد گرفتند و بعد با بقیه تئوریهایی که سمت NTK هست کرنل رو به شبکه کانولوشنی با عرض غیر بینهایتشون برگردوندند.
همه اینها رو گفتیم که چی؟ نکته جذاب ماجرا قسمت آزمایشهاست. همونطور که در تصاویر میبینید مثلا با ساختن یک تصویر برای هر کلاس از MNIST و CIFAR10 تونستند به دقتهای جالب توجهی برسند. در بقیه تصاویر هم تصاویر ساختگی دیتاست کوچک رو اوردیم که کمی جا بیافته که این تصاویر الزاما از توزیع تصاویر طبیعی نیستند و صرفا عصارهای از تصاویر دیتاست هستند.
لینک مقاله اول:
https://arxiv.org/abs/2011.00050
لینک مقاله دوم:
https://arxiv.org/abs/2107.13034
پ.ن: دوستان! لطفا کانال رو با فوروارد کردن پستها و به اشتراک گذاری لینکشون یاری کنید.
#read
#paper
@nlp_stuff
Post #210
2.07K