Наверняка вы встречали в статьях что-то вроде:
«Статистически значимых различий между группами выявлено не было. Таким образом, вмешательство не продемонстрировало эффекта».
На первый взгляд всё логично.
Но вот здесь как раз очень легко сделать лишний шаг в интерпретации.
p > 0,05 означает, что у нас недостаточно оснований отвергнуть нулевую гипотезу.И всё.
Это не равно утверждению «эффекта нет».
Потому что статистическая значимость зависит не только от величины эффекта, но и от того, насколько точно мы смогли его оценить. А точность, в свою очередь, сильно зависит от размера выборки.
Если исследование небольшое, реальный эффект вполне может быть, но данных просто не хватило, чтобы показать его статистически убедительно.
Например, получили:
разница между группами — 1,2 балла
p = 0,2
Можно ли после этого сказать, что методы лечения одинаковы?
Нет.
Нам ещё нужно понять, насколько неопределённа сама оценка этих 1,2 балла.
И вот здесь гораздо интереснее становится посмотреть на 95% доверительный интервал.
Если он широкий и включает, например, и почти нулевой эффект, и достаточно большую разницу между группами, то честный вывод будет примерно таким:
по этим данным мы просто не можем достаточно точно оценить эффект.
А вот другая ситуация.
Исследование большое, оценка точная, доверительный интервал узкий и при этом не включает величину эффекта, которую мы заранее считали клинически значимой.
Тогда результат уже действительно информативен.
Не в смысле «мы доказали, что эффекта нет», а в смысле:
если эффект и есть, то большой клинически значимый эффект по этим данным маловероятен.
И это совсем другой вывод.
Поэтому при
p > 0,05 я бы почти автоматически смотрела ещё на две вещи:какова сама оценка эффекта и какой у неё доверительный интервал.
Без этого фраза «различий не выявлено» говорит гораздо меньше, чем иногда кажется.
И здесь же возникает ещё одна проблема — publication bias.
Исследования, где получили красивое
p < 0,05, публиковать проще и приятнее.А работы, где статистически значимого результата не получилось, заметно чаще остаются в столе.
В итоге, если смотреть только на опубликованную литературу, можно получить слишком оптимистичное представление об эффективности метода, препарата или вмешательства.
Поэтому статистически незначимый результат — это не обязательно «ничего не получилось».
Иногда он действительно мало что говорит.
А иногда, наоборот, даёт очень важную информацию.
Вопрос в том, насколько точно мы смогли оценить возможный эффект.