TGViewer
مقاله | کنفرانس | همایش | سمینار مقاله | کنفرانس | همایش | سمینار @confpaper · 1.59K subscribers
Post #1335 140
🔹 حساسیت و ویژگی؛ چرا «دقت کلی» برای ارزیابی مدل‌های طبقه‌بندی کافی نیست؟

در پژوهش‌هایی که هدف، طبقه‌بندی افراد در دو گروه است، مثلاً «در معرض خطر» و «غیر در معرض خطر»، معمولاً شاخصی به نام دقت کلی گزارش می‌شود.

اما دقت کلی می‌تواند در بعضی داده‌ها تصویر گمراه‌کننده‌ای از عملکرد مدل ایجاد کند.

══════════════

🧠 مسئله از کجا شروع می‌شود؟

فرض کنید در یک نمونه ۱۰۰۰ نفری فقط ۵۰ نفر واقعاً در معرض خطر افت تحصیلی هستند.

اگر مدلی همه افراد را «غیر در معرض خطر» پیش‌بینی کند، ۹۵۰ مورد را درست طبقه‌بندی کرده است.

بنابراین دقت کلی آن برابر ۹۵ درصد می‌شود.

اما این مدل حتی یک فرد واقعاً در معرض خطر را شناسایی نکرده است.

پس دقت بالا لزوماً به معنای مدل مفید نیست.

══════════════

📌 حساسیت چیست؟

حساسیت نشان می‌دهد مدل چه نسبتی از موارد مثبت واقعی را درست شناسایی کرده است.

مثلاً اگر از ۵۰ دانشجوی واقعاً در معرض خطر، مدل ۴۰ نفر را شناسایی کند:

حساسیت = ۸۰ درصد

حساسیت بالا زمانی اهمیت بیشتری دارد که از دست دادن یک مورد مثبت، پیامد مهمی داشته باشد.

══════════════

📌 ویژگی چیست؟

ویژگی نشان می‌دهد مدل چه نسبتی از موارد منفی واقعی را درست شناسایی کرده است.

اگر ۹۵۰ دانشجو واقعاً در معرض خطر نباشند و مدل ۸۵۵ نفر از آن‌ها را درست طبقه‌بندی کند:

ویژگی = ۹۰ درصد

پس حساسیت درباره شناسایی درست «مثبت‌ها» و ویژگی درباره شناسایی درست «منفی‌ها» اطلاعات می‌دهد.

══════════════

✍️ مثال پژوهشی

فرض کنید یک ابزار غربالگری برای شناسایی احتمال فرسودگی تحصیلی طراحی شده است.

مدل اول:

حساسیت = ۹۲ درصد
ویژگی = ۶۰ درصد

مدل دوم:

حساسیت = ۷۰ درصد
ویژگی = ۹۰ درصد

نمی‌توان بدون توجه به هدف پژوهش گفت کدام مدل بهتر است.

اگر هدف غربالگری اولیه باشد و از دست دادن افراد در معرض خطر بسیار پرهزینه باشد، حساسیت اهمیت بیشتری پیدا می‌کند.

اما اگر مثبت کاذب هزینه زیادی ایجاد کند، ویژگی نیز اهمیت بیشتری خواهد داشت.

══════════════

⚠️ خطای رایج: فقط گزارش درصد افراد درست طبقه‌بندی‌شده

وقتی کلاس‌ها نامتوازن باشند، دقت کلی می‌تواند بسیار بالا باشد حتی اگر مدل عملکرد ضعیفی روی گروه مهم‌تر داشته باشد.

به همین دلیل بهتر است همراه با دقت کلی، حداقل این موارد نیز بررسی شوند:

حساسیت،

ویژگی،

تعداد مثبت‌های کاذب،

و تعداد منفی‌های کاذب.

══════════════

📌 آستانه تصمیم بر این شاخص‌ها اثر می‌گذارد

بسیاری از مدل‌ها ابتدا یک احتمال تولید می‌کنند.

مثلاً احتمال ۰٫۷۵ برای «در معرض خطر بودن».

پژوهشگر باید تعیین کند از چه آستانه‌ای به بعد فرد مثبت طبقه‌بندی شود.

اگر آستانه را پایین بیاوریم، معمولاً افراد مثبت بیشتری شناسایی می‌شوند و حساسیت افزایش پیدا می‌کند، اما ممکن است مثبت کاذب نیز بیشتر شود.

پس حساسیت و ویژگی مستقل از آستانه تصمیم نیستند.

══════════════

🎯 انتخاب آستانه باید بر اساس هدف پژوهش باشد

آستانه نباید فقط برای بیشینه کردن یک شاخص آماری انتخاب شود.

باید مشخص باشد:

هزینه منفی کاذب چقدر است؟

هزینه مثبت کاذب چقدر است؟

شیوع پیامد چقدر است؟

و مدل قرار است در چه زمینه‌ای استفاده شود؟

یک آستانه مناسب در یک کاربرد ممکن است در کاربرد دیگری نامناسب باشد.

══════════════

✅ جمع‌بندی

در مدل‌های طبقه‌بندی، دقت کلی به تنهایی کافی نیست.

حساسیت نشان می‌دهد چه تعداد از موارد مثبت واقعی شناسایی شده‌اند.

ویژگی نشان می‌دهد چه تعداد از موارد منفی واقعی درست تشخیص داده شده‌اند.

بنابراین ارزیابی مدل باید بر اساس نوع خطایی انجام شود که در مسئله پژوهش اهمیت بیشتری دارد.

مدلی با «دقت بالا» ممکن است همچنان در شناسایی گروه اصلی مورد نظر عملکرد ضعیفی داشته باشد.

📚 @confpaper
More from @confpaper
  1. Sep 27, 2026🔹 نقض فرض مخاطرات متناسب؛ وقتی اثر یک متغیر در طول زمان ثابت نمی‌ماند در مدل استاندارد کا…
  2. Sep 27, 2026🔹 مدل کاکس؛ چگونه اثر چند متغیر را بر زمان وقوع یک رویداد هم‌زمان بررسی کنیم؟ منحنی کاپلا…
  3. Sep 27, 2026🔹 آزمون لگ‌رنک؛ وقتی دو منحنی بقا متفاوت به نظر می‌رسند، چگونه تفاوت را آزمون کنیم؟ در نم…
  4. Sep 27, 2026🔹 منحنی کاپلان مایر؛ چگونه احتمال بقا را در طول زمان مقایسه کنیم؟ در مطالعات زمان تا روید…
  5. Sep 26, 2026🔹 سانسور در تحلیل بقا؛ چرا «ندیدن رویداد» به معنای «رخ ندادن رویداد» نیست؟ در مطالعات زما…
  6. Sep 26, 2026🔹 نسبت مخاطره با نسبت خطر چه تفاوتی دارد؟ چرا Hazard Ratio را نباید «احتمال وقوع پیامد» ت…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →