TGViewer
مقاله | کنفرانس | همایش | سمینار مقاله | کنفرانس | همایش | سمینار @confpaper · 1.6K subscribers
Post #1332 128
🔹 تقسیم داده به آموزش و آزمون؛ چرا یک مجموعه آزمون باید واقعاً «دست‌نخورده» بماند؟

در مدل‌سازی پیش‌بینی، یکی از رایج‌ترین روش‌ها این است که داده‌ها به دو بخش تقسیم شوند:

بخش آموزش برای ساخت مدل

و بخش آزمون برای ارزیابی نهایی آن

اما اگر مجموعه آزمون در فرایند انتخاب مدل دخالت داده شود، دیگر ارزیابی نهایی مستقل نخواهد بود.

══════════════

🧠 تفاوت داده آموزش و داده آزمون چیست؟

داده آموزش برای این استفاده می‌شود که مدل الگوها و ضرایب را از آن یاد بگیرد.

داده آزمون باید نقش یک نمونه جدید را بازی کند؛ یعنی داده‌ای که مدل در زمان ساخت خود ندیده است.

اگر مدل روی داده آزمون نیز بارها بررسی و اصلاح شود، عملکرد گزارش‌شده دیگر برآورد بی‌طرفانه‌ای از تعمیم مدل نیست.

══════════════

📌 مثال پژوهشی

فرض کنید ۵۰۰ دانشجو داریم و می‌خواهیم عملکرد پژوهشی را پیش‌بینی کنیم.

۳۵۰ نفر برای آموزش و ۱۵۰ نفر برای آزمون کنار گذاشته می‌شوند.

پژوهشگر چند مدل روی ۳۵۰ نفر می‌سازد و سپس هر مدل را روی ۱۵۰ نفر بررسی می‌کند.

اگر بعد از دیدن نتایج آزمون، مدل را تغییر دهد و دوباره همان ۱۵۰ نفر را ارزیابی کند، مجموعه آزمون عملاً وارد فرایند ساخت مدل شده است.

در این وضعیت، دیگر نمی‌توان گفت عملکرد نهایی کاملاً روی داده ندیده ارزیابی شده است.

══════════════

📌 مجموعه آزمون چه زمانی باید استفاده شود؟

بهتر است مجموعه آزمون فقط پس از پایان مراحل اصلی زیر استفاده شود:

انتخاب متغیرها،

تنظیم مدل،

انتخاب شکل نهایی تحلیل،

و تصمیم‌گیری درباره پارامترهای مدل.

تا قبل از آن، ارزیابی‌های مکرر بهتر است در داده آموزش و با روش‌هایی مانند اعتبارسنجی متقابل انجام شوند.

══════════════

⚠️ خطای رایج: انتخاب بهترین مدل بر اساس نتیجه آزمون

فرض کنید ۱۵ مدل ساخته شده است و هر ۱۵ مدل روی مجموعه آزمون اجرا می‌شوند.

سپس مدلی انتخاب می‌شود که بهترین عملکرد را روی همان آزمون داشته است.

در ظاهر مجموعه آزمون مستقل بوده، اما در عمل برای انتخاب مدل استفاده شده است.

نتیجه این است که عملکرد همان مدل در مجموعه آزمون احتمالاً بیش از حد خوش‌بینانه خواهد بود.

══════════════

✍️ راه بهتر چیست؟

یک رویکرد منطقی می‌تواند سه مرحله داشته باشد:

داده آموزش برای برازش مدل،

اعتبارسنجی درون داده آموزش برای انتخاب و تنظیم مدل،

و مجموعه آزمون برای ارزیابی نهایی.

در این ساختار، داده آزمون تا پایان فرایند دست‌نخورده باقی می‌ماند.

══════════════

📌 آیا همیشه باید داده را دو قسمت کنیم؟

نه لزوماً.

اگر حجم نمونه کوچک باشد، کنار گذاشتن بخش بزرگی از داده برای آزمون می‌تواند باعث کاهش دقت برآوردها شود.

در چنین شرایطی، اعتبارسنجی متقابل ممکن است استفاده کارآمدتری از داده باشد.

بنابراین نسبت تقسیم داده باید با حجم نمونه، پیچیدگی مدل و هدف پژوهش هماهنگ باشد.

══════════════

🎯 یک نکته مهم درباره پیش‌پردازش

حتی اقداماتی مانند:

استانداردسازی متغیرها،

برآورد مقادیر گمشده،

انتخاب ویژگی‌ها

و کاهش ابعاد

نباید با استفاده از اطلاعات مجموعه آزمون انجام شوند.

این مراحل باید بر اساس داده آموزش تعیین و سپس همان قواعد روی داده آزمون اعمال شوند.

در غیر این صورت، نشت اطلاعات رخ می‌دهد.

══════════════

✅ جمع‌بندی

مجموعه آزمون فقط زمانی ارزش دارد که واقعاً مستقل از فرایند ساخت مدل باقی بماند.

اگر پس از هر تغییر مدل دوباره به نتیجه آزمون نگاه کنیم، مجموعه آزمون به تدریج تبدیل به بخشی از داده آموزش می‌شود.

قاعده اصلی ساده است:

مدل را در داده آموزش بسازید،

در همان چارچوب تنظیم و اعتبارسنجی کنید،

و مجموعه آزمون را برای ارزیابی نهایی نگه دارید.

آزمون نهایی باید شبیه مواجهه مدل با داده‌ای باشد که قبلاً هرگز ندیده است.

📚 @confpaper
More from @confpaper
  1. Sep 28, 2026🔹 رویدادهای تکرارشونده در تحلیل بقا؛ وقتی هر فرد ممکن است بیش از یک بار رویداد را تجربه ک…
  2. Sep 28, 2026🔹 مدل خطر اختصاصی علت و مدل فاین گری؛ در خطرهای رقابتی کدام سؤال را می‌خواهیم پاسخ دهیم؟…
  3. Sep 28, 2026🔹 خطرهای رقابتی در تحلیل بقا؛ وقتی یک رویداد مانع وقوع رویداد اصلی می‌شود در برخی مطالعات…
  4. Sep 28, 2026🔹 متغیر وابسته به زمان در تحلیل بقا؛ وقتی مقدار یک پیش‌بین در طول مطالعه تغییر می‌کند در…
  5. Sep 27, 2026🔹 نقض فرض مخاطرات متناسب؛ وقتی اثر یک متغیر در طول زمان ثابت نمی‌ماند در مدل استاندارد کا…
  6. Sep 27, 2026🔹 مدل کاکس؛ چگونه اثر چند متغیر را بر زمان وقوع یک رویداد هم‌زمان بررسی کنیم؟ منحنی کاپلا…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →