🔹 حساسیت و ویژگی؛ چرا «دقت کلی» برای ارزیابی مدلهای طبقهبندی کافی نیست؟
در پژوهشهایی که هدف، طبقهبندی افراد در دو گروه است، مثلاً «در معرض خطر» و «غیر در معرض خطر»، معمولاً شاخصی به نام دقت کلی گزارش میشود.
اما دقت کلی میتواند در بعضی دادهها تصویر گمراهکنندهای از عملکرد مدل ایجاد کند.
══════════════
🧠 مسئله از کجا شروع میشود؟
فرض کنید در یک نمونه ۱۰۰۰ نفری فقط ۵۰ نفر واقعاً در معرض خطر افت تحصیلی هستند.
اگر مدلی همه افراد را «غیر در معرض خطر» پیشبینی کند، ۹۵۰ مورد را درست طبقهبندی کرده است.
بنابراین دقت کلی آن برابر ۹۵ درصد میشود.
اما این مدل حتی یک فرد واقعاً در معرض خطر را شناسایی نکرده است.
پس دقت بالا لزوماً به معنای مدل مفید نیست.
══════════════
📌 حساسیت چیست؟
حساسیت نشان میدهد مدل چه نسبتی از موارد مثبت واقعی را درست شناسایی کرده است.
مثلاً اگر از ۵۰ دانشجوی واقعاً در معرض خطر، مدل ۴۰ نفر را شناسایی کند:
حساسیت = ۸۰ درصد
حساسیت بالا زمانی اهمیت بیشتری دارد که از دست دادن یک مورد مثبت، پیامد مهمی داشته باشد.
══════════════
📌 ویژگی چیست؟
ویژگی نشان میدهد مدل چه نسبتی از موارد منفی واقعی را درست شناسایی کرده است.
اگر ۹۵۰ دانشجو واقعاً در معرض خطر نباشند و مدل ۸۵۵ نفر از آنها را درست طبقهبندی کند:
ویژگی = ۹۰ درصد
پس حساسیت درباره شناسایی درست «مثبتها» و ویژگی درباره شناسایی درست «منفیها» اطلاعات میدهد.
══════════════
✍️ مثال پژوهشی
فرض کنید یک ابزار غربالگری برای شناسایی احتمال فرسودگی تحصیلی طراحی شده است.
مدل اول:
حساسیت = ۹۲ درصد
ویژگی = ۶۰ درصد
مدل دوم:
حساسیت = ۷۰ درصد
ویژگی = ۹۰ درصد
نمیتوان بدون توجه به هدف پژوهش گفت کدام مدل بهتر است.
اگر هدف غربالگری اولیه باشد و از دست دادن افراد در معرض خطر بسیار پرهزینه باشد، حساسیت اهمیت بیشتری پیدا میکند.
اما اگر مثبت کاذب هزینه زیادی ایجاد کند، ویژگی نیز اهمیت بیشتری خواهد داشت.
══════════════
⚠️ خطای رایج: فقط گزارش درصد افراد درست طبقهبندیشده
وقتی کلاسها نامتوازن باشند، دقت کلی میتواند بسیار بالا باشد حتی اگر مدل عملکرد ضعیفی روی گروه مهمتر داشته باشد.
به همین دلیل بهتر است همراه با دقت کلی، حداقل این موارد نیز بررسی شوند:
حساسیت،
ویژگی،
تعداد مثبتهای کاذب،
و تعداد منفیهای کاذب.
══════════════
📌 آستانه تصمیم بر این شاخصها اثر میگذارد
بسیاری از مدلها ابتدا یک احتمال تولید میکنند.
مثلاً احتمال ۰٫۷۵ برای «در معرض خطر بودن».
پژوهشگر باید تعیین کند از چه آستانهای به بعد فرد مثبت طبقهبندی شود.
اگر آستانه را پایین بیاوریم، معمولاً افراد مثبت بیشتری شناسایی میشوند و حساسیت افزایش پیدا میکند، اما ممکن است مثبت کاذب نیز بیشتر شود.
پس حساسیت و ویژگی مستقل از آستانه تصمیم نیستند.
══════════════
🎯 انتخاب آستانه باید بر اساس هدف پژوهش باشد
آستانه نباید فقط برای بیشینه کردن یک شاخص آماری انتخاب شود.
باید مشخص باشد:
هزینه منفی کاذب چقدر است؟
هزینه مثبت کاذب چقدر است؟
شیوع پیامد چقدر است؟
و مدل قرار است در چه زمینهای استفاده شود؟
یک آستانه مناسب در یک کاربرد ممکن است در کاربرد دیگری نامناسب باشد.
══════════════
✅ جمعبندی
در مدلهای طبقهبندی، دقت کلی به تنهایی کافی نیست.
حساسیت نشان میدهد چه تعداد از موارد مثبت واقعی شناسایی شدهاند.
ویژگی نشان میدهد چه تعداد از موارد منفی واقعی درست تشخیص داده شدهاند.
بنابراین ارزیابی مدل باید بر اساس نوع خطایی انجام شود که در مسئله پژوهش اهمیت بیشتری دارد.
مدلی با «دقت بالا» ممکن است همچنان در شناسایی گروه اصلی مورد نظر عملکرد ضعیفی داشته باشد.
📚 @confpaper
Post #1335
140