Напомню условие: исследование сравнивало два метода лечения. Разница по шкале боли составила 1,2 балла, 95% ДИ: −0,4 до 2,8,
p = 0,14.Минимально клинически значимой заранее считали разницу 2 балла.
70% выбрали верный ответ:
данные не позволяют исключить клинически значимый эффект нового метода.
Почему остальные варианты не подходят?
«Клинически значимого эффекта нет» — 20%
Точечная оценка действительно ниже нашего порога: 1,2 балла против 2.
Но одного этого недостаточно.
95% доверительный интервал составляет от −0,4 до 2,8 балла. Его верхняя граница выше заранее определённого порога клинической значимости.
То есть с нашими данными совместим и эффект больше 2 баллов. Поэтому сказать, что клинически значимого эффекта нет, мы не можем.
«Новый метод эффективен, но исследованию не хватило мощности» — 15%
Здесь мы, наоборот, делаем слишком сильный вывод в другую сторону.
По этим данным нельзя утверждать, что новый метод эффективен. Доверительный интервал включает 0, то есть данные совместимы и с отсутствием различий.
И
p > 0,05 сам по себе не даёт оснований сказать: «эффект точно есть, просто мощности не хватило».В данном случае правильнее говорить о неопределённости оценки: диапазон возможных значений эффекта пока слишком широк.
«Методы лечения эквивалентны» — 5%
Отсутствие статистически значимых различий не означает эквивалентность.
Для доказательства эквивалентности нужен специально спланированный анализ с заранее заданными границами эквивалентности. Обычного
p > 0,05 для такого вывода недостаточно.Что же мы можем сказать?
Точечная оценка различия — 1,2 балла, то есть меньше заранее выбранного клинически значимого эффекта.
Но 95% ДИ — от −0,4 до 2,8 балла.
Поэтому по этим данным мы не можем ни подтвердить клинически значимый эффект, ни исключить его.
И вот здесь хорошо видно, почему одного p-value бывает мало.
p = 0,14 говорит нам, что статистически значимого различия не получено.А доверительный интервал показывает ещё и насколько неопределённа наша оценка и какие величины эффекта всё ещё совместимы с данными.
Поэтому при
p > 0,05 я бы всегда смотрела дальше:какова величина эффекта, насколько широк доверительный интервал и где проходят его границы относительно клинически значимого эффекта.