🔹 ترکیب نتایج پس از برآورد چندگانه؛ چرا نباید چند فایل برآوردشده را با هم میانگین بگیریم؟
در برآورد چندگانه دادههای گمشده، چند مجموعه داده کامل ساخته میشود و تحلیل اصلی روی هر مجموعه به طور جداگانه اجرا میشود.
اما سؤال مهم این است:
چگونه باید نتایج این تحلیلهای متعدد را به یک نتیجه نهایی تبدیل کرد؟
پاسخ، «ترکیب اصولی برآوردها و عدم قطعیت آنها» است.
══════════════
🧠 چرا یک مجموعه داده کافی نیست؟
فرض کنید ۲۰ مجموعه داده برآوردشده داریم.
در هر مجموعه، ضریب رگرسیون خودکارآمدی پژوهشی کمی متفاوت به دست میآید:
۰٫۳۱
۰٫۲۹
۰٫۳۵
۰٫۳۰
و ...
این تفاوتها تصادفی نیستند؛ بخشی از آنها نشاندهنده عدم قطعیت درباره مقادیر گمشدهاند.
اگر فقط یکی از مجموعهها را انتخاب کنیم، این عدم قطعیت را نادیده گرفتهایم.
══════════════
📌 نتیجه نهایی چگونه ساخته میشود؟
ابتدا ضریب مورد نظر در همه مجموعههای داده برآورد میشود.
سپس میانگین این ضرایب به عنوان برآورد نهایی استفاده میشود.
اما کار در همینجا تمام نمیشود.
برای محاسبه خطای استاندارد باید دو منبع عدم قطعیت با هم ترکیب شوند:
عدم قطعیت داخل هر مجموعه داده
و
تفاوت میان مجموعههای برآوردشده
این منطق اساس قواعد معروف ترکیب نتایج در برآورد چندگانه است.
══════════════
✍️ مثال پژوهشی
فرض کنید در ۲۰ مجموعه داده، میانگین ضریب رگرسیون برابر باشد با:
β = ۰٫۳۲
اگر ضرایب در همه مجموعهها بسیار نزدیک به هم باشند، عدم قطعیت ناشی از دادههای گمشده نسبتاً کم است.
اما اگر ضرایب بین مثلاً ۰٫۱۰ تا ۰٫۵۵ تغییر کنند، این پراکندگی نشان میدهد نتیجه به مقادیر برآوردشده حساس است.
در چنین شرایطی، خطای استاندارد نهایی باید این عدم قطعیت اضافی را منعکس کند.
══════════════
📌 چرا نباید ابتدا فایلها را با هم میانگین بگیریم؟
یک اشتباه رایج این است که پژوهشگر مقادیر برآوردشده در ۲۰ فایل را برای هر فرد میانگین میگیرد و یک فایل «نهایی» میسازد.
این کار بخش مهمی از هدف برآورد چندگانه را از بین میبرد.
زیرا اختلاف بین مجموعههای برآوردشده همان اطلاعاتی است که عدم قطعیت مقادیر گمشده را نشان میدهد.
اگر این اختلاف را حذف کنیم، ممکن است خطای استاندارد بیش از حد کوچک شود.
══════════════
⚠️ خطای رایج دیگر: میانگین گرفتن از مقدارهای p
فرض کنید برای یک ضریب، در ۲۰ تحلیل مختلف ۲۰ مقدار p داریم.
نباید این مقدارهای p را با هم جمع و سپس میانگین گرفت.
ترکیب نتایج باید در سطح برآورد پارامتر و واریانس آن انجام شود، نه با میانگینگیری ساده از مقدارهای p.
ابتدا ضریب و خطای استاندارد به شکل مناسب ترکیب میشوند و سپس استنباط نهایی انجام میشود.
══════════════
📌 تعداد برآوردها چرا اهمیت دارد؟
اگر درصد دادههای گمشده زیاد باشد یا عدم قطعیت برآوردها بالا باشد، استفاده از تعداد بسیار کم مجموعه داده میتواند باعث ناپایداری نتیجه شود.
در بسیاری از تحلیلهای جدید، استفاده از تعداد برآوردهای بیشتر از چند مجموعه محدود توصیه میشود.
تعداد مناسب باید با میزان داده گمشده، پیچیدگی مدل و دقت مورد نیاز هماهنگ باشد.
══════════════
🎯 چه چیزی باید در مقاله گزارش شود؟
بهتر است مشخص شود:
چند مجموعه داده برآوردشده ساخته شده است،
چه روشی برای برآورد استفاده شده،
چه متغیرهایی در مدل برآورد وارد شدهاند،
و نتایج تحلیل چگونه ترکیب شدهاند.
عبارت ساده «دادههای گمشده برآورد شدند» برای ارزیابی کیفیت روش کافی نیست.
══════════════
✅ جمعبندی
در برآورد چندگانه، هدف فقط پر کردن خانههای خالی نیست.
چند مجموعه داده ساخته میشود تا عدم قطعیت درباره مقادیر گمشده نیز وارد تحلیل شود.
بنابراین نتیجه نهایی باید هم:
تغییرپذیری داخل هر مجموعه
و هم
تغییرپذیری بین مجموعهها
را در نظر بگیرد.
اگر چند فایل برآوردشده را به یک فایل میانگین تبدیل کنیم، بخش مهمی از منطق برآورد چندگانه را از بین بردهایم.
📚 @confpaper
Post #1359
59