TGViewer
NLP stuff NLP stuff @nlp_stuff · 3.86K subscribers
Post #278 3.46K
کشف خطاهای سیستماتیک مدل با Domino

با این که مدل‌های یادگیری ماشینی و به خصوص شبکه‌های عمیق بر روی خیلی از تسک‌ها و دیتاست‌ها امتیازهای بالایی را ثبت می‌کنند اما ممکن است هر مدلی بر روی قاچ‌‌های خاصی از داده دچار خطای سیستماتیک باشد. مثلا فرض کنید یک تسک دسته‌بندی تصویر داشته باشیم و مدل آموزش دیده یاد گرفته باشد که هر تصویری که در آن حیوانی را با پس زمینه زمین شنی دید آن را به عنوان شتر برچسب بزند. در این صورت ممکن است در هنگام تست با تصویر گاو بر روی شن مواجه شود و آن را به اشتباه شتر برچسب بزند. این مجموعه داده‌هایی که دارای یک خاصیت ویژه هستند و توسط مدل به اشتباه دسته‌بندی می‌شوند قاچ بحرانی (critical slice) گفته می‌شود. اهمیت پیدا کردن این قاچ‌های بحرانی و اصلاح تصمیم مدل برای آن‌ها برای عملی کردن مدل‌های ماشین لرنینگی بسیار مهم است اما معمولا به علت سختی کار نادیده گرفته می‌شود (برای مثال این کاربرد حیاتی را در نظر بگیرید یک مدل آموزش ‌داده‌اید که از روی تصاویر پزشکی تشخیص میدهد که آیا بیمار سرطان دارد یا خیر). حال دوستانی از استنفورد سعی کرده‌اند یک روش اتوماتیک برای کشف قاچ‌های بحرانی هر مدل با نام Domino ارائه دهند. صورت مساله Domino این است که در واقع با ورودی گرفتن یک مدل و یک دیتاست بایستی تعدادی قاچ‌ پیدا شوند که اولا دیتاهای این قاچ با همدیگر مرتبط باشند؛ یعنی مثلا همگی گاو‌های روی شن باشند و دوما این که عملکرد مدل بر روی دادگان این قاچ‌ها افتضاح باشد.

روش کار domino شامل سه بخش است. به صورت خلاصه domino ابتدا دادگان دیتاست ورودی را با استفاده از مدل‌های cross-modal به یک فضای امبدینگی مشترک با متن می‌برد. (برای مثال اگر دیتاست از جنس تصویر باشد میتوان از مدل قدرتمند clip استفاده کرد) سپس تعدادی از متن‌های کاندیدا برای توضیح این قاچ‌ها نیز توسط همین مدل cross-modal به فضای مشترک نگاشت می‌شوند. سپس در گام دوم، Domino با استفاده از یک مدلسازی mixture سعی در خوشه‌بندی داده‌های به اشتباه برچسب‌گذاری‌شده می‌کند. این مدلسازی برای هر قاچ شامل چهار متغیر S و Z و Y و Y_hat است به ترتیب احتمال تعلق داده به قاچ S، امبدینگ داده، برچسب واقعی داده، توزیع برچسب حدس زده شده توسط مدل). در این مدلسازی فرض شده است که Z و Y و Y_hat به شرط S از یکدیگر مستقل هستند و در واقع از روی S تولید می‌شوند ( برای توضیحات بیشتر می‌توانید قسمت ۵ مقاله را بخوانید). این مدل روی likelihood داده‌های اشتباه برچسب‌گذاری شده به صورت mixture آموزش داده می‌شود. سپس در گام سوم، Domino برای هر slice با توجه به کاندیدای متنی مرحله اول، یک توضیح متنی آماده می‌کند (مثلا "گاو‌های بیابانی")

در ادامه هم اومدند و برای مثال Domino را، روی Resnet آموزش دیده بر روی ImageNet، تست کردند و نشون دادند که Resnet رو قاچ‌های تصاویر داخل ماشین و تصاویر از دور ماشین‌های مسابقه‌ای، مشکل سیستماتیک داره. بعد از این که با این مدل، قاچ‌های بحرانی کشف شدند حالا میشه با تمرکز روی اون قاچ‌ها و مثلا استفاده از افزون‌ساده داده مشکل رو تخفیف داد. کدهای Domino هم منتشر شده و لینک رپوش در صفحه بلاگ حاضره و می‌تونید ازش استفاده کنید. ضمنا این مقاله در ICLR2022 قبول شده.

لینک بلاگ Domino:
https://ai.stanford.edu/blog/domino/
لینک مقاله:
https://arxiv.org/abs/2203.14960

پ.ن. از آقای دکتر شریفی زارچی تشکر می‌کنیم که این مقاله رو در رشته توئیتی برای مقالات خوب کنفرانس ICLR2022 معرفی کردند.

#paper
#read

@nlp_stuff
Telegram stuff
More from @nlp_stuff
  1. Jan 6, 2026اندر حکایات بازی با کلمات: AI Engineering vs ML Engineering/Data Scientist این روزها عناوی…
  2. Mar 3, 2025مفهوم Agent چیست و چگونه کار می‌کنند؟ خانم چیپ هوین بلاگ پست مفصلی راجع به Agent (به قول ر…
  3. Feb 28, 2025خلاصه‌تر فکر کن از اونجایی که در مسائل استدلالی (reasoning) ، مدل برای رسیدن به جواب نهایی…
  4. Feb 23, 2025چه قدر تا بی‌کارشدن بک‌اندی‌ها فاصله داریم؟ عمده استفاده برنامه‌نویس‌ها از LLM‌ها در سطح پ…
  5. Feb 20, 2025به سوی سیستم‌۲ پیشرفت‌های هوش مصنوعی در دهه ۲۰۱۰، مدیون آموزش مدل‌های بزرگ دیپ لرنینگی روی…
  6. Feb 8, 2025مدل‌های استدلالی (reasoning) چیست و چگونه ساخته می‌شوند؟ حتما این روزها بارها مدل‌های استد…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →