🔹 خطای پیشبینی در رگرسیون؛ چرا فقط R² برای ارزیابی مدل کافی نیست؟
در مدلهای پیشبینی، ضریب تعیین نشان میدهد چه مقدار از تغییرات متغیر وابسته توسط مدل توضیح داده میشود.
اما اگر هدف اصلی «پیشبینی دقیق» باشد، دانستن R² به تنهایی کافی نیست.
باید بدانیم پیشبینیهای مدل به طور معمول چقدر با مقادیر واقعی فاصله دارند.
══════════════
🧠 خطای پیشبینی یعنی چه؟
فرض کنید مدل برای نمره کیفیت نگارش یک دانشجو مقدار ۷۸ را پیشبینی کرده است، اما نمره واقعی او ۸۴ بوده است.
خطای پیشبینی برابر است با:
۸۴ منهای ۷۸ = ۶
اگر این محاسبه برای همه افراد انجام شود، مجموعهای از خطاها به دست میآید که میتوان با شاخصهای مختلف خلاصه کرد.
══════════════
📌 میانگین قدرمطلق خطا چیست؟
یکی از شاخصهای ساده و قابل تفسیر، «میانگین قدرمطلق خطا» است.
در این روش، فاصله پیشبینی از مقدار واقعی بدون توجه به علامت آن محاسبه میشود و سپس میانگین گرفته میشود.
اگر این شاخص برابر ۴٫۵ باشد، میتوان گفت:
پیشبینیهای مدل به طور متوسط حدود ۴٫۵ واحد با مقدار واقعی فاصله دارند.
این تفسیر معمولاً مستقیم و قابل فهم است.
══════════════
📌 ریشه میانگین مربعات خطا چه تفاوتی دارد؟
شاخص دیگری که بسیار استفاده میشود «ریشه میانگین مربعات خطا» است.
در این روش، خطاهای بزرگ قبل از میانگینگیری به توان دو میرسند.
در نتیجه، خطاهای بزرگ وزن بیشتری پیدا میکنند.
پس اگر پیشبینیهای بسیار بد برای پژوهش اهمیت ویژهای داشته باشند، این شاخص میتواند حساستر باشد.
══════════════
✍️ مثال پژوهشی
فرض کنید دو مدل برای پیشبینی نمره پایاننامه داریم.
مدل اول:
میانگین قدرمطلق خطا = ۴٫۲
ریشه میانگین مربعات خطا = ۵٫۱
مدل دوم:
میانگین قدرمطلق خطا = ۴٫۰
ریشه میانگین مربعات خطا = ۷٫۸
مدل دوم در خطای معمول کمی بهتر است، اما شاخص دوم نشان میدهد چند خطای بسیار بزرگ دارد.
بنابراین نمیتوان فقط با یک عدد درباره کیفیت مدل تصمیم گرفت.
══════════════
⚠️ خطای رایج: مقایسه خطاها بدون توجه به مقیاس
فرض کنید برای یک متغیر، نمرهها بین صفر تا ۱۰ هستند و خطای متوسط برابر ۳ است.
در متغیر دیگری، نمرهها بین صفر تا ۱۰۰۰ هستند و خطای متوسط نیز ۳ است.
واضح است که اهمیت این دو خطا یکسان نیست.
پس شاخص خطا باید در مقیاس و زمینه متغیر وابسته تفسیر شود.
══════════════
📌 ارزیابی باید روی داده ندیده انجام شود
اگر خطای پیشبینی روی همان دادهای محاسبه شود که مدل با آن ساخته شده، معمولاً بیش از حد خوشبینانه خواهد بود.
برای ارزیابی معتبرتر، خطا باید روی:
داده آزمون،
یا دادههای اعتبارسنجی متقابل
محاسبه شود.
در غیر این صورت، ممکن است فقط توانایی مدل در توضیح دادههای قبلی را اندازه گرفته باشیم.
══════════════
🎯 کدام شاخص بهتر است؟
پاسخ واحدی وجود ندارد.
اگر تفسیر ساده و وزن یکسان برای خطاها مهم باشد، میانگین قدرمطلق خطا مفید است.
اگر خطاهای بزرگ باید جریمه بیشتری دریافت کنند، ریشه میانگین مربعات خطا میتواند مناسبتر باشد.
انتخاب معیار باید با هدف واقعی پیشبینی هماهنگ باشد.
══════════════
✅ جمعبندی
در مدل پیشبینی، R² فقط بخشی از اطلاعات را ارائه میدهد.
برای فهم عملکرد واقعی مدل باید بدانیم:
پیشبینیها چقدر از واقعیت فاصله دارند،
آیا چند خطای بسیار بزرگ وجود دارد،
و این خطاها در دادههای جدید نیز چگونهاند.
مدل خوب فقط مدلی نیست که واریانس زیادی را توضیح دهد.
مدل خوب باید در دادههای ندیده، خطای پیشبینی قابل قبولی نیز داشته باشد.
📚 @confpaper
Post #1334
131