مقالهای مهم در مورد درک بهتر و درست مفاهیم p value و confidence interval و کاربرد درست آنها توسط استاد منصورنیا و همکارانشان منتشر شده است (لینک). اینجا سعی کردم خلاصه ای از آن را قرار دهم:
معمولا در مقالات علمی سه عدد آماری اصلی گزارش میشود:
1- برآورد نقطهای (Point estimate): که بهترین حدس ما از اثر مورد بررسی است
2- مقدار (p-value): عددی بین ۰ تا ۱ که نشان میدهد دادههای ما تا چه حد با یک فرضیه سازگار یا ناسازگارند.
3- فاصله اطمینان (Confidence Interval یا CI): محدودهای که نشان میدهد بر اساس دادهها، اثر واقعی احتمالا در چه بازهای قرار دارد.
در واقع اگر Point estimate بهترین حدس است، فاصله طمینان، بازهای از حدسها دربارهی اندازهی اثر است که دادههای ما با آنها بهطور منطقی سازگار هستند. این بازه بسته به روشی که برای محاسبهاش استفاده شده، ممکن است کمی متفاوت باشد.
نگاه کردن به p-value بهعنوان «میزان سازگاری» دیدگاهی متفاوت از تفسیر سنتی آن بهعنوان معناداری آماری (statistical significance) است.
تفسیر سنتی اغلب اشتباه گرفته میشود و مثلا بهجای معناداری آماری. بهاشتباه اهمیت بالینی (clinical significance) برداشت میشود.
سازگاری یا compatibility یعنی اینکه یک فرضیه تا چه اندازه میتواند دادهها را توضیح دهد یا با آنها همخوانی داشته باشد.
این سازگاری وقتی p=1 باشد در بیشترین حالت خود است و هرچه p به صفر نزدیکتر شود، سازگاری هم کمتر میشو. فرض کنید مطالعهای روی یک برنامه افزایش سرعت انجام میدهیم و فرض صفر (null hypothesis) اینجا بدون اثر بودن آن برنامه باشد. اگر میانگین تغییر مشاهده شده برابر صفر باشد (برآورد نقطهای یا point estimate)، مقدار p برابر یک میشود که نشاندهنده سازگاری کامل (perfect compatibility) بین اثر مشاهده شده و فرضیه صفر است. یعنی دادهها کاملاً با فرضیه بدون اثر بودن سازگارند.
اگر فاصله سازگاری ۹۵٪ (95% compatibility interval) بین −۵ تا ۵ کیلومتر در ساعت باشد، دادههای مشاهدهشده با همه اثرهای فرضی از کاهش شدید (-۵) تا افزایش شدید (۵) سازگار هستند، چون همه این اثرها p>0.05 دارند. این نتیجه نشان میدهد که دادهها دقیق نیستند و نیاز به دادههای بیشتر یا مطالعات بهتر است.
هرچه فاصله سازگاری وسیعتر باشد، دادهها اطلاعات کمتری درباره اندازه واقعی اثر میدهند.
در تحلیلهای آماری معمول، معمولاً فقط مقدار p برای فرض صفر (null hypothesis) محاسبه میشود و نتیجه را بهصورت دوحالته تفسیر میکنند: اگر p≤0.05 باشد «معنادار» (significant) و اگر p>0.05 باشد «غیرمعنادار» (non-significant). این نوع تفسیر اشتباه است، چون اندازه اثر (effect size) را نادیده میگیرد و باعث میشود پژوهشگر یا پزشک فکر کند صرفاً چون p≤0.05 بوده، اثر واقعاً مهم یا معنادار است، یا اگر p>0.05 بوده، هیچ اثری وجود ندارد. در حالی که pهای نزدیک به هم مثل 0.049 و 0.051 از نظر علمی تقریباً هیچ تفاوتی ندارند.
چنین مرزبندیهای مصنوعی باعث میشود پژوهشها به سمت نتایج با p≤0.05 تمایل پیدا کنند (bias toward significant results)، چون این نوع نتایج راحتتر منتشر میشوند. گاهی هم برعکس، وقتی محقق میخواهد نشان دهد درمانی بیخطر است، تمایل به p>0.05 دیده میشود (bias toward non-significance).
رویکرد سازگاری (compatibility approach) پیشنهاد میکند به جای تمرکز روی معنادار بودن یا نبودن، به همخوانی دادهها با فرضیه و زمینه بالینی توجه کنیم تا نتیجهگیریها واقعیتر و کاربردیتر باشند.
قبل از آنکه دادههای یک مطالعه را تحلیل کنیم، باید مشخص کنیم چه میزان اثر، نشاندهنده برتری درمان نسبت به روش معمول است. اول باید به برآورد نقطهای (point estimate) و فاصله سازگاری (interval estimate) توجه کنیم، نه فقط به p-value. برای مثال اگر میانگین تغییر فشار خون ۰ باشد و فاصله اطمینان از منفی ۸ تا مثبت ۸ باشد، یعنی دادهها هم با کاهش ۸ و هم با افزایش ۸ میلیمتر جیوه مطابق هستند. یعنی هنوز مطمئن نیستیم درمان مفید است یا ضرر رسان. فقط میدانیم عدم قطعیت خیلی زیاد است. حالا اگر میانگین تغییر فشار خون، ۱ باشد ( و به مقدار ۲ که مد نظر ما از قبل بوده نرسیده باشد) و فاصله اطمینان بین 0.5 تا 1.5 باشد (با p حتی خیلی پایین مثلا 0.001)، یعنی اثر از نظر آماری مهم است، ولی از نظر بالینی ممکن است آن قدر کم باشد که در عمل مهم نباشد.
تصویر پایین پست توصیه های کلیدی مطالعه را نشان میدهد.
@Scientometric
Post #7085
26.1K
- ❤ 37
- 👍 11
- 🔥 3
- 👎 1
- 🤩 1