TGViewer
مقاله | کنفرانس | همایش | سمینار مقاله | کنفرانس | همایش | سمینار @confpaper · 1.59K subscribers
Post #1358 70
🔹 برآورد چندگانه داده‌های گمشده؛ چرا نباید جای خالی را فقط با یک عدد پر کنیم؟

وقتی بخشی از داده‌ها گمشده است، یکی از واکنش‌های رایج این است که برای هر مقدار گمشده یک عدد جایگزین کنیم؛ مثلاً میانگین متغیر.

این روش ساده است، اما یک مشکل اساسی دارد:

عدم قطعیت واقعی درباره مقدار گمشده را نادیده می‌گیرد.

یکی از روش‌های مناسب‌تر، «برآورد چندگانه» است.

══════════════

🧠 ایده اصلی برآورد چندگانه چیست؟

در این روش برای هر مقدار گمشده فقط یک عدد ساخته نمی‌شود.

چند مجموعه داده کامل ایجاد می‌شود و در هر مجموعه، مقادیر گمشده بر اساس اطلاعات موجود کمی متفاوت برآورد می‌شوند.

مثلاً ممکن است برای یک نمره گمشده اضطراب، در مجموعه‌های مختلف مقادیر زیر برآورد شوند:

۳٫۲

۳٫۵

۳٫۱

۳٫۴

هدف این تفاوت‌ها بازنمایی عدم قطعیت درباره مقدار واقعی گمشده است.

══════════════

📌 بعد از ساخت چند مجموعه داده چه می‌شود؟

فرض کنید ۲۰ مجموعه داده برآوردشده ساخته شده است.

تحلیل اصلی، مثلاً رگرسیون، در هر ۲۰ مجموعه جداگانه اجرا می‌شود.

در پایان، ضرایب و خطاهای استاندارد با قواعد مشخصی با یکدیگر ترکیب می‌شوند.

بنابراین نتیجه نهایی فقط عدم قطعیت معمول تحلیل را در نظر نمی‌گیرد، بلکه عدم قطعیت ناشی از داده‌های گمشده نیز وارد محاسبه می‌شود.

══════════════

✍️ مثال پژوهشی

فرض کنید می‌خواهیم رابطه خودکارآمدی پژوهشی و کیفیت نگارش علمی را بررسی کنیم.

برای ۱۵ درصد افراد، نمره کیفیت نگارش در مرحله دوم گمشده است.

اگر فقط موارد کامل را تحلیل کنیم، بخشی از نمونه حذف می‌شود.

اگر میانگین را جایگزین کنیم، پراکندگی واقعی داده کاهش پیدا می‌کند.

اما در برآورد چندگانه، از اطلاعاتی مانند:

نمره مرحله اول،

معدل،

اضطراب پژوهشی،

مقطع تحصیلی

و سایر متغیرهای مرتبط

برای برآورد مقادیر محتمل استفاده می‌شود.

══════════════

📌 چرا جایگزینی با میانگین مشکل دارد؟

فرض کنید میانگین اضطراب برابر ۳٫۴ باشد.

اگر برای همه افراد دارای داده گمشده مقدار ۳٫۴ قرار دهیم، به طور مصنوعی تعداد زیادی مشاهده دقیقاً در مرکز توزیع ایجاد می‌کنیم.

نتیجه می‌تواند:

واریانس را کاهش دهد،

همبستگی‌ها را تغییر دهد،

و خطای استاندارد را کمتر از مقدار واقعی نشان دهد.

یعنی داده ظاهراً کامل می‌شود، اما ساختار آماری آن تحریف می‌شود.

══════════════

⚠️ برآورد چندگانه داده واقعی تولید نمی‌کند

مقادیر برآوردشده نباید مانند اندازه‌گیری‌های واقعی در نظر گرفته شوند.

این روش صرفاً با استفاده از اطلاعات موجود، عدم قطعیت مربوط به داده‌های مشاهده‌نشده را مدل می‌کند.

هرچه اطلاعات پیش‌بینی‌کننده مقادیر گمشده ضعیف‌تر باشند، عدم قطعیت نیز بیشتر خواهد بود.

══════════════

📌 چه متغیرهایی باید در مدل برآورد وارد شوند؟

یکی از خطاهای رایج این است که فقط متغیرهای تحلیل نهایی وارد مدل شوند.

در حالی که متغیرهایی که:

با احتمال گم شدن مرتبط‌اند،

مقدار متغیر گمشده را پیش‌بینی می‌کنند،

یا اطلاعات کمکی ارزشمندی دارند

نیز می‌توانند مفید باشند.

انتخاب این متغیرها باید بر اساس منطق آماری و موضوعی انجام شود.

══════════════

🎯 آیا برآورد چندگانه مشکل MNAR را حل می‌کند؟

نه لزوماً.

روش‌های معمول برآورد چندگانه اغلب تحت فرض‌هایی نزدیک به MAR اجرا می‌شوند.

اگر احتمال گم شدن داده حتی پس از کنترل اطلاعات موجود به مقدار مشاهده‌نشده وابسته باشد، نتیجه ممکن است همچنان حساس به فرض‌های مدل باشد.

در چنین شرایطی تحلیل حساسیت اهمیت بیشتری پیدا می‌کند.

══════════════

✅ جمع‌بندی

برآورد چندگانه به جای اینکه برای هر داده گمشده یک مقدار قطعی بسازد، چند مقدار محتمل تولید می‌کند و عدم قطعیت آن‌ها را وارد تحلیل می‌کند.

مزیت اصلی آن این است که:

اطلاعات افراد ناقص را حفظ می‌کند،

عدم قطعیت را نادیده نمی‌گیرد،

و از مشکلات روش‌هایی مانند جایگزینی با میانگین جلوگیری می‌کند.

اما این روش نیز به مدل و مفروضات خود وابسته است.

هدف «حدس زدن مقدار واقعی» نیست؛ هدف این است که تحلیل، عدم قطعیت ناشی از داده‌های گمشده را صادقانه‌تر منعکس کند.

📚 @confpaper
More from @confpaper
  1. Oct 1, 2026🔹 امتیاز تمایل؛ چگونه در مطالعات مشاهده‌ای گروه‌ها را قابل‌مقایسه‌تر کنیم؟ در مطالعات مشا…
  2. Oct 1, 2026🔹 برآورد دوگانه مقاوم؛ چرا ترکیب وزن‌دهی و مدل پیامد می‌تواند مفید باشد؟ در تحلیل داده‌ها…
  3. Oct 1, 2026🔹 وزن‌دهی احتمال معکوس؛ چگونه ریزش نمونه را در تحلیل طولی تعدیل کنیم؟ در مطالعات طولی، یک…
  4. Sep 30, 2026🔹 تحلیل حساسیت برای داده‌های گمشده؛ اگر فرض MAR درست نباشد، نتیجه چقدر تغییر می‌کند؟ بسیا…
  5. Sep 30, 2026🔹 ترکیب نتایج پس از برآورد چندگانه؛ چرا نباید چند فایل برآوردشده را با هم میانگین بگیریم؟…
  6. Sep 30, 2026🔹 MCAR، MAR و MNAR؛ سه سازوکار داده گمشده که انتخاب روش تحلیل به آن‌ها وابسته است وقتی بخ…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →