🔹 MCAR، MAR و MNAR؛ سه سازوکار داده گمشده که انتخاب روش تحلیل به آنها وابسته است
وقتی بخشی از دادهها گمشدهاند، فقط درصد گمشده بودن مهم نیست.
مسئله اصلی این است که:
«احتمال گم شدن داده به چه چیزی وابسته است؟»
در آمار معمولاً سه سازوکار اصلی برای دادههای گمشده مطرح میشود:
MCAR، MAR و MNAR.
══════════════
🧠 MCAR؛ گمشده کاملاً تصادفی
در این حالت، احتمال گم شدن داده به هیچ متغیر مشاهدهشده یا مشاهدهنشده مرتبط نیست.
مثلاً تعدادی پرسشنامه به علت یک خطای فنی تصادفی از بین رفتهاند و این اتفاق ارتباطی با ویژگیهای پاسخدهندگان ندارد.
اگر این فرض واقعاً برقرار باشد، افراد دارای داده کامل میتوانند تقریباً نماینده کل نمونه باشند.
اما در پژوهشهای واقعی، این فرض معمولاً نسبتاً قوی است.
══════════════
📌 MAR؛ گمشده تصادفی مشروط به اطلاعات مشاهدهشده
در این حالت، گم شدن داده میتواند به اطلاعاتی که در اختیار داریم وابسته باشد.
فرض کنید دانشجویان با معدل پایین بیشتر احتمال دارد در مرحله دوم مطالعه شرکت نکنند.
اگر معدل مرحله اول ثبت شده باشد، میتوان از این اطلاعات برای مدلسازی احتمال گم شدن داده استفاده کرد.
در این شرایط، پس از در نظر گرفتن متغیرهای مشاهدهشده مرتبط، گم شدن داده به مقدار مشاهدهنشده وابستگی اضافی ندارد.
این منطق پایه بسیاری از روشهای پیشرفته مدیریت داده گمشده است.
══════════════
✍️ مثال پژوهشی
فرض کنید اضطراب پژوهشی در پایان ترم برای برخی دانشجویان اندازهگیری نشده است.
تحلیل نشان میدهد احتمال عدم پاسخ در دانشجویانی که در ابتدای ترم معدل پایینتر و اضطراب اولیه بالاتری داشتهاند بیشتر بوده است.
اگر این متغیرها ثبت شده باشند، ممکن است فرض MAR نسبت به MCAR واقعبینانهتر باشد.
در این حالت، حذف ساده افراد ناقص بخشی از اطلاعات مفید موجود را نادیده میگیرد.
══════════════
📌 MNAR؛ گمشده غیرتصادفی
این حالت زمانی مطرح میشود که احتمال گم شدن داده به خود مقدار مشاهدهنشده وابسته باشد، حتی پس از کنترل اطلاعات موجود.
مثلاً افرادی که در پایان مطالعه اضطراب بسیار بالایی دارند، دقیقاً به دلیل همان اضطراب بالا از پاسخ دادن خودداری کنند.
مشکل اینجاست که مقدار اصلی اضطراب آنها را مشاهده نکردهایم.
بنابراین سازوکار گم شدن مستقیماً به چیزی وابسته است که در داده موجود نیست.
══════════════
⚠️ چرا تشخیص MNAR دشوار است؟
از روی دادههای مشاهدهشده معمولاً نمیتوان با قطعیت اثبات کرد که دادهها MAR یا MNAR هستند.
زیرا MNAR درباره مقادیری صحبت میکند که اساساً مشاهده نشدهاند.
به همین دلیل، پژوهشگر باید از:
دانش موضوعی،
نحوه جمعآوری داده،
دلایل عدم پاسخ
و تحلیل حساسیت
استفاده کند.
══════════════
📌 یک خطای رایج: اجرای آزمون و اعلام قطعی نوع داده گمشده
گاهی تصور میشود با یک آزمون آماری میتوان کاملاً مشخص کرد دادهها MCAR، MAR یا MNAR هستند.
برخی آزمونها میتوانند شواهدی علیه MCAR ارائه دهند، اما معمولاً نمیتوان فقط با داده مشاهدهشده، MAR را از MNAR به طور قطعی تفکیک کرد.
پس این طبقهبندی فقط یک تصمیم نرمافزاری نیست؛ بخشی از استدلال روششناختی پژوهش است.
══════════════
🎯 چرا این سه سازوکار مهماند؟
زیرا روش مناسب برخورد با داده گمشده به آنها وابسته است.
حذف موارد کامل ممکن است تحت برخی شرایط قابل قبول باشد، اما در بسیاری از حالتهای MAR کارایی و اعتبار کمتری دارد.
روشهایی مانند برآورد درستنمایی و برآورد چندگانه دادههای گمشده معمولاً تحت فرضهایی نزدیک به MAR استفاده میشوند.
برای MNAR نیز اغلب به مدلسازی اختصاصی و تحلیل حساسیت نیاز داریم.
══════════════
✅ جمعبندی
سه سؤال متفاوت وجود دارد:
MCAR:
آیا گم شدن کاملاً مستقل از دادههاست؟
MAR:
آیا گم شدن با اطلاعاتی که مشاهده کردهایم قابل توضیح است؟
MNAR:
آیا گم شدن حتی پس از در نظر گرفتن اطلاعات موجود، به مقدار مشاهدهنشده وابسته است؟
بنابراین قبل از انتخاب روش مدیریت دادههای گمشده، فقط نپرسید:
«چند درصد داده نداریم؟»
بپرسید:
«چه سازوکاری ممکن است باعث شده باشد این دادهها گم شوند؟»
📚 @confpaper
Post #1357
58