👰♀️ Нельзя смотреть на невесту 👰♀️
...до свадьбы, потому что можно ошибиться, как при промежуточном анализе...
Сейчас при подготовке к публикации результатов исследования ECOS‑VVR мне пришлось заранее оправдываться за промежуточный анализ, который был проведён без заявленных статистических границ (т.к. ИИ назвал это место самым слабым).
Хотя, чем больше я читаю академические (в особенности хирургические) исследования, тем больше понимаю, что даже если объём выборки был рассчитан заранее, то чаще всего на цифрах из собственного опыта или удобных литературных данных, по результатам которых получается вполне осиливаемая авторами выборка. Ну а если не получается, то можно сразу запланировать промежуточный анализ половины случаев.
Вот только смотреть на промежуточные данные просто так нельзя, т.к. это тратит бюджет альфа. Что это значит?
При расчёте мощности исследования мы исходно закладываем ошибку I рода (альфа) обычно на уровне 0,05, что предполагает вероятность увидеть различия, которых нет, на уровне 5%. Но только в том случае, если мы посмотрим один раз. Если продолжать подглядывать за невестой до свадьбы, то вероятность ошибки возрастает до 10% при двух и до 40% при десяти просмотрах.
Таким образом, промежуточный анализ подчиняется правилам множественных сравнений и требует соответствующей коррекции, т.е. деления ошибки на число подглядываний. Проще всего было бы распилить альфу по числу осмотров (поправка Бонферрони), но этот подход слишком консервативен и не учитывает увеличивающуюся со временем мощность исследования (трата половины альфы на треть выборки выглядит очень расточительно). Кроме того, Бонферрони предполагает независимость тестов, а промежуточные анализы используют одни и те же данные.
Поэтому были придуманы функции, которые распределяют бюджет альфа в зависимости от достигнутого процента объёма выборки. Работает это следующим образом: если мы заложили альфу 0,05 (т.е. для статистической значимости p должно быть <0,05), то часть из этого значения мы истратим на промежуточном анализе, а остаток - на финальном, если первый не достигнет достоверности. Например, если на предварительном анализе у нас альфа 0,005, то на финальном - 0,045. Это позволит нам законно завершить исследование, если при первом просмотре данных p будет <0,005, но если нет, то придётся продолжить набор участников и на финальном этапе считать значимым уже p<0,045.
Для наглядности будем сравнивать функции для промежуточного анализа 50% включённых пациентов.
👰♀️ O’Brien–Fleming - консервативная функция, в которой на начальных этапах цена альфы невелика, но резко возрастает к концу исследования: для 50% это будет 0,005, что оставит 0,045 для финального анализа.
👰♀️ Pocock - функция с равномерным распределением, которая на половине выборки съест почти половину альфы (0,022), оставив на финальный анализ только 0,028.
👰♀️ Haybittle–Peto - не функция, а простое либеральное правило: ранний порог 0,001 ничего не съедает и оставляет 0,05 на финальный анализ.
👰♀️ Lan–DeMets может иметь вид всех предыдущих функций, но при этом проявляет адаптивность: она позволяет провести любое, а не заранее фиксированное, число просмотров на любом сроке, например, на 45% и 55%, а не только 50%. При этом, пороги p пересчитываются автоматически в момент анализа, исходя из фактической доли информации, что недопустимо при использовании фиксированных критериев.
Ну а если вы всё же ненароком взглянули на невесту раньше времени, и она вам понравилась, то в 2026 году пока ещё работает лайфхак: набор был приостановлен/прерван ввиду пандемии COVID-19, что формально позволяет считать промежуточный анализ незапланированным и не тратящим бюджет альфа.
Post #710
834