🔹 کالیبراسیون مدل؛ چرا یک مدل با AUC خوب ممکن است احتمالهای بدی تولید کند؟
مدلهای طبقهبندی معمولاً فقط افراد را به دو گروه تقسیم نمیکنند؛ بلکه برای هر فرد یک احتمال نیز تولید میکنند.
مثلاً مدل ممکن است احتمال افت تحصیلی یک دانشجو را ۰٫۸۰ برآورد کند.
اما سؤال مهم این است:
آیا افرادی که احتمال ۸۰ درصد گرفتهاند، واقعاً تقریباً در ۸۰ درصد موارد پیامد مورد نظر را تجربه میکنند؟
این همان مسئله «کالیبراسیون» است.
══════════════
🧠 کالیبراسیون یعنی چه؟
کالیبراسیون به میزان تطابق احتمالهای پیشبینیشده با فراوانی واقعی پیامد اشاره دارد.
فرض کنید ۱۰۰ دانشجو هر کدام احتمال حدود ۰٫۷۰ برای افت تحصیلی دریافت کردهاند.
اگر حدود ۷۰ نفر از آنها واقعاً دچار افت شوند، مدل از نظر کالیبراسیون عملکرد مناسبی دارد.
اما اگر فقط ۳۰ نفر دچار افت شوند، مدل احتمال خطر را بیش از حد برآورد کرده است.
══════════════
📌 تفاوت کالیبراسیون با قدرت تفکیک چیست؟
قدرت تفکیک نشان میدهد مدل تا چه اندازه افراد پرخطر را بالاتر از افراد کمخطر رتبهبندی میکند.
شاخصهایی مانند AUC بیشتر این جنبه را بررسی میکنند.
اما کالیبراسیون میپرسد:
«آیا مقدار احتمال پیشبینیشده خودش درست است؟»
یک مدل میتواند افراد را به خوبی رتبهبندی کند، اما احتمالهای آن بیش از حد بزرگ یا کوچک باشند.
══════════════
✍️ مثال پژوهشی
فرض کنید دو مدل برای پیشبینی احتمال ترک تحصیل داریم.
هر دو تقریباً دانشجویان پرخطر و کمخطر را به ترتیب مشابهی رتبهبندی میکنند.
اما مدل اول برای یک گروه از دانشجویان احتمال خطر ۶۰ درصد پیشبینی میکند و در واقع حدود ۵۸ درصد آنها ترک تحصیل میکنند.
مدل دوم برای همان گروه احتمال ۹۰ درصد پیشبینی میکند، در حالی که فقط ۶۰ درصد پیامد را تجربه میکنند.
ممکن است قدرت تفکیک هر دو مدل مشابه باشد، اما مدل اول کالیبراسیون بهتری دارد.
══════════════
📌 نمودار کالیبراسیون چه چیزی نشان میدهد؟
در نمودار کالیبراسیون، احتمالهای پیشبینیشده با میزان واقعی وقوع پیامد مقایسه میشوند.
اگر مدل کاملاً کالیبره باشد، نقاط باید تقریباً نزدیک خط ۴۵ درجه قرار بگیرند.
اگر نقاط به طور منظم بالاتر یا پایینتر از این خط قرار گیرند، مدل ممکن است خطر را کمبرآورد یا بیشبرآورد کند.
══════════════
⚠️ خطای رایج: تفسیر احتمال مدل به عنوان احتمال واقعی بدون بررسی کالیبراسیون
اگر مدل برای فردی احتمال ۰٫۸۵ تولید کند، نباید خودکار نتیجه گرفت:
«احتمال واقعی وقوع پیامد برای این فرد ۸۵ درصد است.»
این تفسیر زمانی قابل دفاعتر است که مدل در جمعیت مورد نظر به خوبی کالیبره شده باشد.
در غیر این صورت، این عدد ممکن است فقط یک امتیاز نسبی باشد.
══════════════
📌 چرا کالیبراسیون در جمعیت جدید تغییر میکند؟
حتی اگر یک مدل در نمونه اولیه خوب کالیبره باشد، ممکن است در جمعیت دیگری عملکرد متفاوتی داشته باشد.
برای مثال اگر شیوع پیامد در دانشگاه دوم با دانشگاهی که مدل در آن ساخته شده متفاوت باشد، احتمالهای پیشبینیشده نیز ممکن است نیاز به تنظیم مجدد داشته باشند.
بنابراین کالیبراسیون باید در جامعه هدف ارزیابی شود.
══════════════
🎯 چه زمانی کالیبراسیون اهمیت ویژه دارد؟
زمانی که قرار است از «مقدار احتمال» برای تصمیمگیری استفاده شود.
مثلاً:
اگر احتمال خطر بالاتر از ۳۰ درصد باشد، مداخله انجام شود.
در این شرایط، فقط رتبهبندی افراد کافی نیست؛ مقدار احتمال نیز باید قابل اعتماد باشد.
══════════════
✅ جمعبندی
قدرت تفکیک و کالیبراسیون دو ویژگی متفاوت مدل هستند.
قدرت تفکیک میگوید:
«آیا مدل افراد پرخطر و کمخطر را از هم جدا میکند؟»
کالیبراسیون میگوید:
«آیا احتمالهایی که مدل گزارش میکند با میزان واقعی وقوع پیامد هماهنگاند؟»
یک مدل پیشبینی خوب باید تا حد امکان هر دو ویژگی را داشته باشد.
پس بعد از گزارش AUC، هنوز یک سؤال مهم باقی میماند:
«آیا احتمالهای پیشبینیشده واقعاً قابل اعتمادند؟»
📚 @confpaper
Post #1338
98