Групповой последовательный анализ
TL;DR
Позволяет адаптировать Z‑тест к последовательному применению. Эффективен в случае быстро вызревающих метрик и наличия изменений.
Почему обсуждается?
В подходе Вальда нужно знать параметрическое семейство (например, биномиальное или нормальное). Это ограничение можно преодолеть с помощью Group Sequential Testing (GST).
Проблема
Хотим завершать эксперимент быстрее, если в метрике уже наблюдаются значительные отклонения. При этом данные поступают батчами (например, по дням или по неделям).
Предположения
– Мы зафиксировали размер выборки N.
– Каждый батч содержит достаточно наблюдений, чтобы была применима ЦПТ.
– Выборка из независимых и одинаково распределённых величин.
Решение
Фиксируем:
– размер выборки N,
– α-spending функцию α(t).
Здесь α(t) - накопленная вероятность ошибки на выборке размера N t.
Свойства α-spending функции:
– α(0) = 0,
– α(1) - уровень значимости,
– α(t) - неубывающая функция.
Во время теста:
1. Получаем новый батч объёмом ΔN(j).
2. Обновляем долю выборки t(j) = N(j) / Ν, где N(j) = N(j-1) + ΔΝ(j) - накопленный объём выборки.
3. Находим такой порог z(j), чтобы вероятность ошибки за первые j батчей равнялась α(t(j)). Для вычисления порога используем аналитические формулы или моделирование.
4. Считаем статистику Z-теста Z(j) по N(j) наблюдениям.
5. Если Z(j) > z(j) → принимаем H(1); иначе — продолжаем.
6. Если дошли до полного объёма N и не приняли H(1) → принимаем H(0).
Достоинства
Подходит для использования на быстро вызревающую метрику. Отлично подходит для метрик здоровья, на которые нежелательно влиять самим экспериментом (например, ошибки, задержки, отказоустойчивость).
– Уменьшает среднее N при H(1).
– Позволяет быстрее остановить тест, если изменения больше MDE δ.
– Работает с классической статистикой Z-теста. Можно использовать и другие критерии в рамках аналогичной последовательной процедуры.
– Условия применимости те же, что у Z-теста.
– Можно использовать двустороннюю или другую сложную альтернативу H(1).
– Выбор α-spending функции даёт гибкость в регулировании скорости принятия решений.
Ограничения
Общие для последовательных критериев
– Очень сложно применять, если метрика долго вызревает.
– При завершении теста мы не всегда можем построить хороший доверительный интервал для значения метрики.
– Обладает меньшей мощностью в сравнении с fixed horizon подходом.
Специфичные для GST
– GST не позволяет досрочно остановить тест при верной H(0), что ограничивает применимость подхода для целевой метрики.
– Выбор α-spending функции не всегда очевиден — требует экспертной настройки или моделирования.
– Вычисление порогов z(j) может быть вычислительно затратным, так как для них нет простой аналитической формы.
– Определение N при заданных MDE и мощности возможно, но требует численного решения.
Библиография
– Gordon Lan K., DeMets D. Discrete sequential boundaries for clinical trials // Biometrika. – 1983. – Т. 70. – № 3. – С. 659-663.
– Использование последовательного тестирования для уменьшения размера выборки.
– Kim K., Tsiatis A. Independent increments in group sequential tests: a review // SORT: statistics and operations research transactions. – 2020. – Т. 44. – № 2. – С. 223-264.
– Pocock S. Group sequential methods in the design and analysis of clinical trials // Biometrika. – 1977. – Т. 64. – № 2. – С. 191-199.
Post #6
1.42K
- 🔥 12
- ❤ 3
- 👍 3
- 🦄 2