🔹 تقسیم داده به آموزش و آزمون؛ چرا یک مجموعه آزمون باید واقعاً «دستنخورده» بماند؟
در مدلسازی پیشبینی، یکی از رایجترین روشها این است که دادهها به دو بخش تقسیم شوند:
بخش آموزش برای ساخت مدل
و بخش آزمون برای ارزیابی نهایی آن
اما اگر مجموعه آزمون در فرایند انتخاب مدل دخالت داده شود، دیگر ارزیابی نهایی مستقل نخواهد بود.
══════════════
🧠 تفاوت داده آموزش و داده آزمون چیست؟
داده آموزش برای این استفاده میشود که مدل الگوها و ضرایب را از آن یاد بگیرد.
داده آزمون باید نقش یک نمونه جدید را بازی کند؛ یعنی دادهای که مدل در زمان ساخت خود ندیده است.
اگر مدل روی داده آزمون نیز بارها بررسی و اصلاح شود، عملکرد گزارششده دیگر برآورد بیطرفانهای از تعمیم مدل نیست.
══════════════
📌 مثال پژوهشی
فرض کنید ۵۰۰ دانشجو داریم و میخواهیم عملکرد پژوهشی را پیشبینی کنیم.
۳۵۰ نفر برای آموزش و ۱۵۰ نفر برای آزمون کنار گذاشته میشوند.
پژوهشگر چند مدل روی ۳۵۰ نفر میسازد و سپس هر مدل را روی ۱۵۰ نفر بررسی میکند.
اگر بعد از دیدن نتایج آزمون، مدل را تغییر دهد و دوباره همان ۱۵۰ نفر را ارزیابی کند، مجموعه آزمون عملاً وارد فرایند ساخت مدل شده است.
در این وضعیت، دیگر نمیتوان گفت عملکرد نهایی کاملاً روی داده ندیده ارزیابی شده است.
══════════════
📌 مجموعه آزمون چه زمانی باید استفاده شود؟
بهتر است مجموعه آزمون فقط پس از پایان مراحل اصلی زیر استفاده شود:
انتخاب متغیرها،
تنظیم مدل،
انتخاب شکل نهایی تحلیل،
و تصمیمگیری درباره پارامترهای مدل.
تا قبل از آن، ارزیابیهای مکرر بهتر است در داده آموزش و با روشهایی مانند اعتبارسنجی متقابل انجام شوند.
══════════════
⚠️ خطای رایج: انتخاب بهترین مدل بر اساس نتیجه آزمون
فرض کنید ۱۵ مدل ساخته شده است و هر ۱۵ مدل روی مجموعه آزمون اجرا میشوند.
سپس مدلی انتخاب میشود که بهترین عملکرد را روی همان آزمون داشته است.
در ظاهر مجموعه آزمون مستقل بوده، اما در عمل برای انتخاب مدل استفاده شده است.
نتیجه این است که عملکرد همان مدل در مجموعه آزمون احتمالاً بیش از حد خوشبینانه خواهد بود.
══════════════
✍️ راه بهتر چیست؟
یک رویکرد منطقی میتواند سه مرحله داشته باشد:
داده آموزش برای برازش مدل،
اعتبارسنجی درون داده آموزش برای انتخاب و تنظیم مدل،
و مجموعه آزمون برای ارزیابی نهایی.
در این ساختار، داده آزمون تا پایان فرایند دستنخورده باقی میماند.
══════════════
📌 آیا همیشه باید داده را دو قسمت کنیم؟
نه لزوماً.
اگر حجم نمونه کوچک باشد، کنار گذاشتن بخش بزرگی از داده برای آزمون میتواند باعث کاهش دقت برآوردها شود.
در چنین شرایطی، اعتبارسنجی متقابل ممکن است استفاده کارآمدتری از داده باشد.
بنابراین نسبت تقسیم داده باید با حجم نمونه، پیچیدگی مدل و هدف پژوهش هماهنگ باشد.
══════════════
🎯 یک نکته مهم درباره پیشپردازش
حتی اقداماتی مانند:
استانداردسازی متغیرها،
برآورد مقادیر گمشده،
انتخاب ویژگیها
و کاهش ابعاد
نباید با استفاده از اطلاعات مجموعه آزمون انجام شوند.
این مراحل باید بر اساس داده آموزش تعیین و سپس همان قواعد روی داده آزمون اعمال شوند.
در غیر این صورت، نشت اطلاعات رخ میدهد.
══════════════
✅ جمعبندی
مجموعه آزمون فقط زمانی ارزش دارد که واقعاً مستقل از فرایند ساخت مدل باقی بماند.
اگر پس از هر تغییر مدل دوباره به نتیجه آزمون نگاه کنیم، مجموعه آزمون به تدریج تبدیل به بخشی از داده آموزش میشود.
قاعده اصلی ساده است:
مدل را در داده آموزش بسازید،
در همان چارچوب تنظیم و اعتبارسنجی کنید،
و مجموعه آزمون را برای ارزیابی نهایی نگه دارید.
آزمون نهایی باید شبیه مواجهه مدل با دادهای باشد که قبلاً هرگز ندیده است.
📚 @confpaper
Post #1332
128