🔴 "نگاه و تفسیری جدید از P Value در کارآزمایی های بالینی"
مقاله منتشر شده در مجله NEJM Evidence که طی آن بیش از ۲۳ هزار کارآزمایی بالینی بررسی شده است.
این مطالعه نشان داده است که یک P Value با مقدار خیلی کم، حتما به معنای قدرت یا Power بالای (۸۰ یا حتی ۹۰%) مطالعه کارآزمایی بالینی نیست.
این یک برداشت اشتباه است که P Value با مقدار خیلی کم دلیل بر قدرت بالای مطالعه است و اگر مطالعه تکرار شود حتما نتایج تایید می شود. نتایج مطالعه نشان داده است که احتمالا مقدار P Value اولیه بین 0.001 و 0.005 نشان دهنده اغراق قابل توجه در اثر واقعی چیزی است که بررسی شده است.
به علت وجود این مشکل قدرت یا Power، یافته های با برچسب "statistically significant" میتوانند یک اغراق از اثر واقعی باشند و همین طور یافتههای با برچسب "not significant" نیز میتوانند در واقع یافتههای مربوط به اثرات مهم و قابل توجه باشند و علاوه بر آن اینجا مشکل تکرارپذیری هم بوجود می آید.
محققین با بررسی یک جمعیت مرجع از بیش از ۲۳ هزار کارآزمایی بالینی، به تفسیر جدیدی از P vlaue پرداخته و یک راهنمای تجربی برای تفسیر آن را ارائه کرده اند.
✅ در تلاش برای بررسی تکرارپذیری نتایج مطالعه (replication)، به عنوان مثال، برای یک مقدار P Value اولیه بین 0.001 و 0.005، تنها 58% احتمال دیده شدن P Value کمتر یا مساوی 0.05 وجود داشته است. این از جدول سوم مقاله مشخص است.
✅ از طرفی بر اساس همین جدول، برای مطالعات با گزارش مقدار P Value اولیه بین 0.01 و 0.05:
احتمال این که فاصله اطمینان ۹۵%، دربردارنده اثر واقعی باشد فقط ۹۰ درصد بوده است و
احتمال این که یک مطالعه دیگر با همین مشخصات، بتواند مقدار P Value کمتر از پنج صدم گزارش کند، برابر با ۳۷ درصد بوده است اما
خوشبختانه احتمال درست بودن جهت اثر برآورد شده ۹۵% بوده است.
برای اثر با مقدار P Value گزارش شده در این بازه (بین 0.01 و 0.05)، احتمال برآورد بیش از حد بزرگی یک اثر به اندازه حداقل ۵%، ۵۶% و ۱۸۱% به ترتیب ۷۵، ۵۰ و ۲۵% بوده است!
✅ به صورت کلی احتمال این که فاصله اطمینان ۹۵%، دربردارنده اثر واقعی باشد برای مقادیر P Value های بزرگ بیش از ۹۵% و برای مقادیر P Value کوچک کمتر از ۹۵% بوده است! خوشبختانه احتمال این که جهت اثر برآورد شده درست باشد برای P Value های کوچکتر از پنج صدم، بالا بوده است.
✅ برای مطالعات با P Value از 0.005 تا 0.001، احتمال تکرار نتایج به شکلی که P Value کمتر یا مساوی پنج صدم داشته باشیم، کم است. پس اگر در تکرار مطالعه، P Value بیش از پنج صدم داشتیم، این به آن معنا نخواهد بود که یافته مطالعه اولیه بر حسب تصادف یا حتما اشتباه بوده است. همان طور که وجود P Value کمتر از پنج صدم (مخصوصا وقتی نزدیک به پنج صدم باشد) در مطالعه اولیه به معنای حتما درست بودن نتیجه گیری نبوده است و این تاکید بر این است که تکیه تنها بر P Value درست نیست.
مطالعه نشان داده است که اکثر کارآزمایی های بالینی بررسی شده، قدرت آماری قوی برای تشخیص اثرات واقعی که به دنبال آن هستند نداشته اند.
اگر مطالعات به صورت معمول دارای قدرت بالا (مثل ۸۰٪) بودند، ما اغلب مقادیر P Value بسیار پایین (مثلاً بین 0.42 و 0.0000016) می دیدیم و مقادیر P کمتر از 0.0005 را حداقل در یک چهارم موارد مشاهده می کردیم. از آنجایی هم که ما معمولا این مقادیر از P Value را نمی بینیم در نتیجه داشتن P Value اولیه بین 0.001 و 0.005 هم نباید به عنوان قدرت بالای مطالعه کارآزمایی بالینی تفسیر شود.
در بسیاری موارد، مطالعات شرکتکنندگان کمی دارند ( inadequate sample size)، و محققان از مقدار P کمتر از 0.05 برای تصمیمگیری در مورد سطح معناداری استفاده میکنند. در نتیجه جای تعجب ندارد که تکرار پذیری برای این مطالعات با شکست مواجه شده و یا برای داشتن نتایج مشابه، مطالعات بعدی باید حجم نمونه بالاتری داشته باشند و تکیه تنها بر مقدار ارزش احتمال کمتر از پنج صدم برای ادعاها رویکرد خوبی نیست.
برخی پست های قبلی مرتبط در کانال @Scientometric
✅ فراخوان دانشمندان در منع استفاده از اهمیت آماری، بازنشسته کردن Statistical Significance و بیان فاصله سازگاری به جای فاصله اطمینان (لینک)
✅ بازنشسته کردن سطح معنی داری وکنار گذاشتن ارزش احتمال یا همان P Value میتواند منجر به افزایش سوگیری شود. (اینجا)
✅ مقاله دکتر سندر گرينلند و دکتر محمدعلی منصورنيا (اینجا)
✅ تعداد 44 مقاله در شماره جدید مجله ی The American Statistician در باب عبور از ارزش احتمال (P Value) و دنیای بعد از سطح معنی داری پنج صدم! (اینجا)
✅ آیا سطح معنی داری ارزش احتمال (P value) باید به پنج هزارم تغییر کند؟ (مقاله جاما)
✅ ساده تر کردن مفهوم P value (اینجا و اینجا)
Post #6682
14.2K
- 👍 36
- 🤯 9
- 👏 6
- ❤ 2
- 👎 1
- 👌 1