🔹 برآورد چندگانه دادههای گمشده؛ چرا نباید جای خالی را فقط با یک عدد پر کنیم؟
وقتی بخشی از دادهها گمشده است، یکی از واکنشهای رایج این است که برای هر مقدار گمشده یک عدد جایگزین کنیم؛ مثلاً میانگین متغیر.
این روش ساده است، اما یک مشکل اساسی دارد:
عدم قطعیت واقعی درباره مقدار گمشده را نادیده میگیرد.
یکی از روشهای مناسبتر، «برآورد چندگانه» است.
══════════════
🧠 ایده اصلی برآورد چندگانه چیست؟
در این روش برای هر مقدار گمشده فقط یک عدد ساخته نمیشود.
چند مجموعه داده کامل ایجاد میشود و در هر مجموعه، مقادیر گمشده بر اساس اطلاعات موجود کمی متفاوت برآورد میشوند.
مثلاً ممکن است برای یک نمره گمشده اضطراب، در مجموعههای مختلف مقادیر زیر برآورد شوند:
۳٫۲
۳٫۵
۳٫۱
۳٫۴
هدف این تفاوتها بازنمایی عدم قطعیت درباره مقدار واقعی گمشده است.
══════════════
📌 بعد از ساخت چند مجموعه داده چه میشود؟
فرض کنید ۲۰ مجموعه داده برآوردشده ساخته شده است.
تحلیل اصلی، مثلاً رگرسیون، در هر ۲۰ مجموعه جداگانه اجرا میشود.
در پایان، ضرایب و خطاهای استاندارد با قواعد مشخصی با یکدیگر ترکیب میشوند.
بنابراین نتیجه نهایی فقط عدم قطعیت معمول تحلیل را در نظر نمیگیرد، بلکه عدم قطعیت ناشی از دادههای گمشده نیز وارد محاسبه میشود.
══════════════
✍️ مثال پژوهشی
فرض کنید میخواهیم رابطه خودکارآمدی پژوهشی و کیفیت نگارش علمی را بررسی کنیم.
برای ۱۵ درصد افراد، نمره کیفیت نگارش در مرحله دوم گمشده است.
اگر فقط موارد کامل را تحلیل کنیم، بخشی از نمونه حذف میشود.
اگر میانگین را جایگزین کنیم، پراکندگی واقعی داده کاهش پیدا میکند.
اما در برآورد چندگانه، از اطلاعاتی مانند:
نمره مرحله اول،
معدل،
اضطراب پژوهشی،
مقطع تحصیلی
و سایر متغیرهای مرتبط
برای برآورد مقادیر محتمل استفاده میشود.
══════════════
📌 چرا جایگزینی با میانگین مشکل دارد؟
فرض کنید میانگین اضطراب برابر ۳٫۴ باشد.
اگر برای همه افراد دارای داده گمشده مقدار ۳٫۴ قرار دهیم، به طور مصنوعی تعداد زیادی مشاهده دقیقاً در مرکز توزیع ایجاد میکنیم.
نتیجه میتواند:
واریانس را کاهش دهد،
همبستگیها را تغییر دهد،
و خطای استاندارد را کمتر از مقدار واقعی نشان دهد.
یعنی داده ظاهراً کامل میشود، اما ساختار آماری آن تحریف میشود.
══════════════
⚠️ برآورد چندگانه داده واقعی تولید نمیکند
مقادیر برآوردشده نباید مانند اندازهگیریهای واقعی در نظر گرفته شوند.
این روش صرفاً با استفاده از اطلاعات موجود، عدم قطعیت مربوط به دادههای مشاهدهنشده را مدل میکند.
هرچه اطلاعات پیشبینیکننده مقادیر گمشده ضعیفتر باشند، عدم قطعیت نیز بیشتر خواهد بود.
══════════════
📌 چه متغیرهایی باید در مدل برآورد وارد شوند؟
یکی از خطاهای رایج این است که فقط متغیرهای تحلیل نهایی وارد مدل شوند.
در حالی که متغیرهایی که:
با احتمال گم شدن مرتبطاند،
مقدار متغیر گمشده را پیشبینی میکنند،
یا اطلاعات کمکی ارزشمندی دارند
نیز میتوانند مفید باشند.
انتخاب این متغیرها باید بر اساس منطق آماری و موضوعی انجام شود.
══════════════
🎯 آیا برآورد چندگانه مشکل MNAR را حل میکند؟
نه لزوماً.
روشهای معمول برآورد چندگانه اغلب تحت فرضهایی نزدیک به MAR اجرا میشوند.
اگر احتمال گم شدن داده حتی پس از کنترل اطلاعات موجود به مقدار مشاهدهنشده وابسته باشد، نتیجه ممکن است همچنان حساس به فرضهای مدل باشد.
در چنین شرایطی تحلیل حساسیت اهمیت بیشتری پیدا میکند.
══════════════
✅ جمعبندی
برآورد چندگانه به جای اینکه برای هر داده گمشده یک مقدار قطعی بسازد، چند مقدار محتمل تولید میکند و عدم قطعیت آنها را وارد تحلیل میکند.
مزیت اصلی آن این است که:
اطلاعات افراد ناقص را حفظ میکند،
عدم قطعیت را نادیده نمیگیرد،
و از مشکلات روشهایی مانند جایگزینی با میانگین جلوگیری میکند.
اما این روش نیز به مدل و مفروضات خود وابسته است.
هدف «حدس زدن مقدار واقعی» نیست؛ هدف این است که تحلیل، عدم قطعیت ناشی از دادههای گمشده را صادقانهتر منعکس کند.
📚 @confpaper
Post #1358
70