دادههای گمشده را فقط حذف نکنید
در بسیاری از پایاننامهها، اگر چند پرسشنامه ناقص باشد یا بعضی خانههای داده خالی بماند، سادهترین تصمیم این است که آن موارد حذف شوند.
اما حذف دادههای ناقص همیشه تصمیم درستی نیست و حتی میتواند نتیجه پژوهش را منحرف کند. 📊
━━━━━━━━━━━━━━
اول بپرسید چرا داده گم شده است
مهم نیست فقط چند داده گمشده دارید؛ مهم است بدانید گمشدن آنها چه الگویی دارد.
مثلاً اگر افراد با ویژگی خاصی بیشتر سؤالهای حساس را بدون پاسخ گذاشته باشند، دادههای گمشده تصادفی نیستند.
در چنین شرایطی، حذف ساده این افراد میتواند نمونه باقیمانده را متفاوت کند.
━━━━━━━━━━━━━━
حذف کامل افراد چه مشکلی دارد؟
در «تحلیل موارد کامل»، هر فردی که در متغیرهای موردنیاز داده ناقص داشته باشد از تحلیل کنار گذاشته میشود.
این روش ممکن است:
• حجم نمونه را کاهش دهد
• توان آماری را کم کند
• و در برخی شرایط باعث سوگیری برآوردها شود
بنابراین نباید صرفاً به دلیل ساده بودن، بهصورت خودکار استفاده شود.
━━━━━━━━━━━━━━
جایگزینی با میانگین هم راهحل خوبی نیست ⚠️
گاهی مقدار گمشده را با میانگین همان متغیر پر میکنند.
این روش ساده است، اما معمولاً عدم قطعیت واقعی دادههای گمشده را نادیده میگیرد و میتواند واریانس و روابط میان متغیرها را مخدوش کند.
━━━━━━━━━━━━━━
راه مناسب چیست؟
روش برخورد با دادههای گمشده باید براساس:
• مقدار و الگوی دادههای گمشده
• علت احتمالی گمشدن داده
• نوع متغیرها
• مدل آماری پژوهش
• و فرضهای روش انتخابی
تعیین شود.
در برخی پژوهشها، روشهایی مانند «جایگذاری چندگانه» میتوانند مناسبتر باشند، اما آنها هم نیازمند فرضها و اجرای صحیح هستند.
━━━━━━━━━━━━━━
جمعبندی
قبل از حذف دادههای ناقص، فقط نپرسید:
«چند درصد داده گمشده داریم؟»
بپرسید:
چرا این دادهها گم شدهاند؟ آیا افراد دارای داده ناقص با بقیه تفاوت دارند؟ حذف آنها چه اثری بر نتایج میگذارد؟ و کدام روش آماری با سازوکار گمشدن داده سازگارتر است؟
داده گمشده فقط یک مشکل نرمافزاری نیست؛ یک مسئله روششناختی است.
@researchyarr
Post #1814
335
- 👍 1