TGViewer
NLP stuff NLP stuff @nlp_stuff · 3.86K subscribers
Post #210 2.07K
گلاب‌گیری از دیتاست!

یادگیری عمیق سهم زیادی از پیشرفت خودش رو مدیون دیتاست‌های بزرگه. با این وجود، آموزش روی این دیتاست‌های بزرگ هزینه محاسباتی و زمانی زیادی رو تحمیل می‌کنه. کنار این عقبه ذهنی، بحث روش‌های یادگیری نمونه‌محور و کرنل رو هم در نظر داشته باشید که از هر کلاس چند نمونه رو به عنوان مجموعه ساپورت در نظر می‌گیرند و برای هر نمونه جدیدی با کمک این نمونه‌های ساپورت پیش‌بینی می‌کنند. هر دوی این مطالب اهمیت کاهش سایز دیتاست رو نشون میده.

ساده‌ترین نگاه میتونه این باشه که چند تا نمونه از دیتاست رو انتخاب کنیم و نگهداری کنیم که اما در عمل نشون داده فعلا موثر نیست و به قدر کافی اطلاعات نگه‌داری نمی‌کنند (هیچ چند تا گاوی نیستند که راجع به همه گاو‌های دنیا بتونن اطلاعات بدهند). اینجاست که تکنیکی به نام Dataset Distillation وارد بازی می‌شه (به احتمال زیاد کلمه Distillation رو در موضوع شبکه‌های عصبی شنیدید اما اگر نشنیدید به طور خلاصه اینه که یک مدل کوچکتر رو به نحوی آموزش میدیم که بتونه عصاره دانش مدل بزرگتر رو یاد بگیره و مثل اون رفتار کنه) اینجا ما به دنبال یادگیری دیتاست ساختگی کوچک از یک دیتاست اصلی بزرگ هستیم که یادگیری مدل روی دیتاست کوچیک مشابه یادگیری مدل روی دیتاست بزرگ تموم بشه. به صورت کلی یادگیری این دیتاست کوچک میتونه مستلزم به محاسبه گرادیان مرتبه دوم بشه که چغر و بدبدنه.

در چند ماه اخیر چندین روش Dataset Distillation اومدند که از زوایای مختلف سعی در رخنه به این مساله داشتند، یکی از این زوایا استفاده از کرنله. در اولین مقاله مورد بحثمون، اومدند و مساله رو به صورت Kernel Ridge Regression مدل کردند به صورتی که شما یک کرنل پیش‌فرضی دارید و دیتاست کوچیک نمونه‌‌های آموزشی و دیتاست بزرگ نمونه‌های تستی هستند و بایستی مدل KRR آموزش یافته روی دیتاست کوچک میزان لاسش بر دیتاست بزرگ کمینه بشه. از اینجا روابطش بر حسب نمونه‌های دیتاست کوچک به دست میاد و اون‌ها رو به همراه لیبل‌هاشون می‌شه یادگرفت (اسم کل این الگوریتم رو هم گذاشتن KIP و LS).

حالا چند ماه بعد از این مقاله، مقاله دیگه‌ای اومده و با توجه به قضایای مطرح شده Neural Tangent Kernel که بیان میکنه هر شبکه بسیار عریضی (شبکه‌ای که تعداد نورون‌هاش در لایه به بی‌نهایت میل می‌کنه) رو میشه به یک کرنل مپ کرد سعی کرده قضیه رو جلو ببره (این NTK خودش دنیای جداییه که اگر درد بی‌دردی دارید می‌تونید بخونیدش). پس در ادامه یک شبکه کانولوشنی چندلایه رو فرض کردند و با فرض عریض بودنش کرنلش رو استخراج کردند سپس با روش مقاله قبلی دیتاست کوچک رو یاد گرفتند و بعد با بقیه تئوری‌هایی که سمت NTK هست کرنل رو به شبکه کانولوشنی با عرض غیر بی‌نهایتشون برگردوندند.

همه اینها رو گفتیم که چی؟ نکته جذاب ماجرا قسمت آزمایش‌هاست. همونطور که در تصاویر می‌بینید مثلا با ساختن یک تصویر برای هر کلاس از MNIST و CIFAR10 تونستند به دقت‌های جالب توجهی برسند. در بقیه تصاویر هم تصاویر ساختگی دیتاست کوچک رو اوردیم که کمی جا بیافته که این تصاویر الزاما از توزیع تصاویر طبیعی نیستند و صرفا عصاره‌ای از تصاویر دیتاست هستند.

لینک مقاله اول:
https://arxiv.org/abs/2011.00050
لینک مقاله دوم:
https://arxiv.org/abs/2107.13034

پ.ن: دوستان! لطفا کانال رو با فوروارد کردن پست‌ها و به اشتراک گذاری لینکشون یاری کنید.

#read
#paper

@nlp_stuff
Telegram stuff
More from @nlp_stuff
  1. Jan 6, 2026اندر حکایات بازی با کلمات: AI Engineering vs ML Engineering/Data Scientist این روزها عناوی…
  2. Mar 3, 2025مفهوم Agent چیست و چگونه کار می‌کنند؟ خانم چیپ هوین بلاگ پست مفصلی راجع به Agent (به قول ر…
  3. Feb 28, 2025خلاصه‌تر فکر کن از اونجایی که در مسائل استدلالی (reasoning) ، مدل برای رسیدن به جواب نهایی…
  4. Feb 23, 2025چه قدر تا بی‌کارشدن بک‌اندی‌ها فاصله داریم؟ عمده استفاده برنامه‌نویس‌ها از LLM‌ها در سطح پ…
  5. Feb 20, 2025به سوی سیستم‌۲ پیشرفت‌های هوش مصنوعی در دهه ۲۰۱۰، مدیون آموزش مدل‌های بزرگ دیپ لرنینگی روی…
  6. Feb 8, 2025مدل‌های استدلالی (reasoning) چیست و چگونه ساخته می‌شوند؟ حتما این روزها بارها مدل‌های استد…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →