TGViewer
Math for Impact Math for Impact @mathforimpact · 782 subscribers
Post #6 1.42K
Групповой последовательный анализ

TL;DR

Позволяет адаптировать Z‑тест к последовательному применению. Эффективен в случае быстро вызревающих метрик и наличия изменений.

Почему обсуждается?
В подходе Вальда нужно знать параметрическое семейство (например, биномиальное или нормальное). Это ограничение можно преодолеть с помощью Group Sequential Testing (GST).

Проблема
Хотим завершать эксперимент быстрее, если в метрике уже наблюдаются значительные отклонения. При этом данные поступают батчами (например, по дням или по неделям).

Предположения
– Мы зафиксировали размер выборки N.
– Каждый батч содержит достаточно наблюдений, чтобы была применима ЦПТ.
– Выборка из независимых и одинаково распределённых величин.

Решение
Фиксируем:
– размер выборки N,
– α-spending функцию α(t).

Здесь α(t) - накопленная вероятность ошибки на выборке размера N t.
Свойства α-spending функции:
– α(0) = 0,
– α(1) - уровень значимости,
– α(t) - неубывающая функция.

Во время теста:
1. Получаем новый батч объёмом ΔN(j).
2. Обновляем долю выборки t(j) = N(j) / Ν, где N(j) = N(j-1) + ΔΝ(j) - накопленный объём выборки.
3. Находим такой порог z(j), чтобы вероятность ошибки за первые j батчей равнялась α(t(j)). Для вычисления порога используем аналитические формулы или моделирование.
4. Считаем статистику Z-теста Z(j) по N(j) наблюдениям.
5. Если Z(j) > z(j) → принимаем H(1); иначе — продолжаем.
6. Если дошли до полного объёма N и не приняли H(1) → принимаем H(0).

Достоинства
Подходит для использования на быстро вызревающую метрику. Отлично подходит для метрик здоровья, на которые нежелательно влиять самим экспериментом (например, ошибки, задержки, отказоустойчивость).
– Уменьшает среднее N при H(1).
– Позволяет быстрее остановить тест, если изменения больше MDE δ.
– Работает с классической статистикой Z-теста. Можно использовать и другие критерии в рамках аналогичной последовательной процедуры.
– Условия применимости те же, что у Z-теста.
– Можно использовать двустороннюю или другую сложную альтернативу H(1).
– Выбор α-spending функции даёт гибкость в регулировании скорости принятия решений.

Ограничения
Общие для последовательных критериев
– Очень сложно применять, если метрика долго вызревает.
– При завершении теста мы не всегда можем построить хороший доверительный интервал для значения метрики.
– Обладает меньшей мощностью в сравнении с fixed horizon подходом.

Специфичные для GST
– GST не позволяет досрочно остановить тест при верной H(0), что ограничивает применимость подхода для целевой метрики.
– Выбор α-spending функции не всегда очевиден — требует экспертной настройки или моделирования.
– Вычисление порогов z(j) может быть вычислительно затратным, так как для них нет простой аналитической формы.
– Определение N при заданных MDE и мощности возможно, но требует численного решения.

Библиография
– Gordon Lan K., DeMets D. Discrete sequential boundaries for clinical trials // Biometrika. – 1983. – Т. 70. – № 3. – С. 659-663.
– Использование последовательного тестирования для уменьшения размера выборки.
– Kim K., Tsiatis A. Independent increments in group sequential tests: a review // SORT: statistics and operations research transactions. – 2020. – Т. 44. – № 2. – С. 223-264.
– Pocock S. Group sequential methods in the design and analysis of clinical trials // Biometrika. – 1977. – Т. 64. – № 2. – С. 191-199.
  • 🔥 12
  • ❤ 3
  • 👍 3
  • 🦄 2
More from @mathforimpact
  1. Mar 5, 2026Привет! Потихоньку возвращаюсь к каналу, параллельно меняя работу. Пока готовлю материалы…
  2. Dec 6, 2025Практический гид по A/B-тестам TL;DR Наша команда собрала опыт в формате ежедневных коротк…
  3. Nov 20, 2025A/B тестирование большого числа моделей TL;DR Позволяет эффективно проводить эксперименты…
  4. Oct 25, 2025Условная максимизация в uplift моделировании TL;DR Позволяет персонализировать принятие ре…
  5. Oct 6, 2025Оценка качества персонализации TL;DR Позволяет оценить эффективность персонализации без пр…
  6. Sep 21, 2025Uplift моделирование: Causal Random Forest TL;DR Позволяет персонализировать принятие реше…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →