TGViewer
مقاله | کنفرانس | همایش | سمینار مقاله | کنفرانس | همایش | سمینار @confpaper · 1.6K subscribers
Post #1329 130
🔹 بیش‌برازش در رگرسیون؛ وقتی مدل داده‌های فعلی را خوب توضیح می‌دهد اما در نمونه جدید شکست می‌خورد

یکی از خطاهای مهم در مدل‌سازی آماری این است که مدلی بسازیم که با داده‌های فعلی بسیار خوب سازگار باشد، اما بخش زیادی از این سازگاری ناشی از ویژگی‌های تصادفی همان نمونه باشد.

به این وضعیت «بیش‌برازش» گفته می‌شود.

══════════════

🧠 بیش‌برازش دقیقاً یعنی چه؟

فرض کنید برای پیش‌بینی کیفیت نگارش علمی، ۲۰ متغیر مختلف وارد مدل کرده‌ایم.

مدل در نمونه موجود ضریب تعیین بسیار بالایی دارد.

اما اگر همان مدل روی گروه دیگری از دانشجویان اجرا شود، عملکرد آن به شکل محسوسی افت می‌کند.

یعنی مدل فقط الگوی واقعی را یاد نگرفته است؛ بخشی از نویز و ویژگی‌های خاص نمونه را نیز جذب کرده است.

══════════════

📌 چرا تعداد زیاد پیش‌بین‌ها خطر را بیشتر می‌کند؟

هر متغیر جدید به مدل آزادی بیشتری برای تطبیق با داده‌ها می‌دهد.

اگر حجم نمونه محدود باشد و تعداد پیش‌بین‌ها زیاد شود، مدل می‌تواند روابطی را ثبت کند که در واقع پایدار نیستند.

در چنین شرایطی ممکن است:

R² بالا باشد،

چند ضریب معنادار دیده شود،

اما مدل در نمونه جدید همان عملکرد را تکرار نکند.

══════════════

✍️ مثال پژوهشی

فرض کنید ۱۲۰ دانشجو داریم و برای پیش‌بینی عملکرد پژوهشی ۲۵ متغیر وارد رگرسیون می‌کنیم.

پس از چند بار تغییر مدل، ترکیبی پیدا می‌شود که:

R² = ۰٫۶۵

دارد.

این مقدار ظاهراً بسیار مطلوب است.

اما اگر مدل روی نمونه مستقل دیگری اجرا شود و R² به ۰٫۲۸ برسد، بخش زیادی از موفقیت اولیه احتمالاً ناشی از بیش‌برازش بوده است.

══════════════

📌 بیش‌برازش فقط به تعداد متغیرها مربوط نیست

خطر بیش‌برازش زمانی بیشتر می‌شود که پژوهشگر:

مدل‌های زیادی را امتحان کند،

متغیرها را بر اساس مقدار p انتخاب کند،

تعامل‌های متعدد بسازد،

تبدیل‌های مختلف را بررسی کند،

و فقط بهترین نتیجه نهایی را گزارش کند.

هرچه انتخاب مدل بیشتر تحت تأثیر همان داده‌ای باشد که بعداً برای ارزیابی مدل استفاده می‌شود، خطر خوش‌بینی بیش از حد افزایش می‌یابد.

══════════════

⚠️ خطای رایج: بهترین مدل در همان نمونه را بهترین مدل واقعی بدانیم

مدلی که در داده آموزش بهترین عملکرد را دارد، الزاماً مدلی نیست که در جامعه واقعی بهتر عمل کند.

ممکن است یک مدل ساده‌تر، در نمونه فعلی کمی R² پایین‌تری داشته باشد اما در داده‌های جدید پایدارتر باشد.

بنابراین کیفیت مدل فقط با برازش داخل همان نمونه سنجیده نمی‌شود.

══════════════

🎯 چگونه خطر بیش‌برازش را کاهش دهیم؟

چند راه مهم وجود دارد:

مدل را بر اساس نظریه طراحی کنیم،

تعداد پیش‌بین‌ها را با حجم نمونه متناسب نگه داریم،

از انتخاب گسترده و پسینی متغیرها خودداری کنیم،

و عملکرد مدل را در داده‌ای غیر از داده مورد استفاده برای ساخت مدل بررسی کنیم.

روش‌هایی مانند اعتبارسنجی متقابل نیز برای همین هدف به کار می‌روند.

══════════════

📌 تفاوت «برازش» و «تعمیم» را جدی بگیرید

برازش خوب یعنی مدل داده‌های موجود را خوب توضیح می‌دهد.

تعمیم خوب یعنی مدل در داده‌های جدید نیز عملکرد قابل قبولی دارد.

مدل علمی مطلوب باید تا حد امکان هر دو ویژگی را داشته باشد.

══════════════

✅ جمع‌بندی

بیش‌برازش زمانی رخ می‌دهد که مدل بیش از آنکه الگوی واقعی را یاد بگیرد، ویژگی‌های خاص و تصادفی نمونه را جذب کند.

نشانه ظاهری آن می‌تواند یک مدل بسیار قوی در داده فعلی باشد.

اما آزمون واقعی مدل این است:

آیا در نمونه جدید نیز عملکرد آن حفظ می‌شود؟

در مدل‌سازی، هدف فقط بالا بردن R² نیست.

هدف ساختن مدلی است که فراتر از همان داده‌ای که با آن ساخته شده، قابل استفاده باشد.

📚 @confpaper
More from @confpaper
  1. Sep 28, 2026🔹 رویدادهای تکرارشونده در تحلیل بقا؛ وقتی هر فرد ممکن است بیش از یک بار رویداد را تجربه ک…
  2. Sep 28, 2026🔹 مدل خطر اختصاصی علت و مدل فاین گری؛ در خطرهای رقابتی کدام سؤال را می‌خواهیم پاسخ دهیم؟…
  3. Sep 28, 2026🔹 خطرهای رقابتی در تحلیل بقا؛ وقتی یک رویداد مانع وقوع رویداد اصلی می‌شود در برخی مطالعات…
  4. Sep 28, 2026🔹 متغیر وابسته به زمان در تحلیل بقا؛ وقتی مقدار یک پیش‌بین در طول مطالعه تغییر می‌کند در…
  5. Sep 27, 2026🔹 نقض فرض مخاطرات متناسب؛ وقتی اثر یک متغیر در طول زمان ثابت نمی‌ماند در مدل استاندارد کا…
  6. Sep 27, 2026🔹 مدل کاکس؛ چگونه اثر چند متغیر را بر زمان وقوع یک رویداد هم‌زمان بررسی کنیم؟ منحنی کاپلا…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →