TGViewer
A/B Testicles A/B Testicles @abtesticles · 643 subscribers
Post #60 1.29K
Пост-коллаба вообще со всеми

Сережа написал хорошее резюме по стратификации и ее уродливой сестричке рерандомизации. Почитайте, чтобы понимать, о чем речь.

На ахе, кстати, про рерандомизацию рассказывал Ян Пиле из Магнита. И у него на слайде распределение p-value с рерандомизацией при H0 было равномерным, а не скошенным влево, как можно было бы ожидать. Я подошел спросил а че это. Он сказал, что если к рерандомизации прикрутить CUPED, то распределение неожиданным образом выравнивается. В докладе Андрея Романова из Авито, кстати, происходит то же самое. Не чудо ли это? Не чудо – Ян прислал такую статью с разбором этого явления

Обычно с запросом на рерандомизацию приходят по одной из двух причин. Первая – хотят увеличить мощность. Немного сложно сделать в онлайне, проблематично корректно посчитать SE (из-за чего собственно и появляется перекос распределения p-value), скорее всего, не сильно эффективно (по крайней мере, на больших выборках), но в целом ОК.

Но если к вам приходят с запросом на рерандомизацию по причине "разъехались ковариаты на предпериоде, значит результаты невалидны", самое время присесть с человеком и рассказать ему поподробнее о том, как устроена статистика. Мне кажется, что подобные опасения в первую очередь возникают у людей из-за того, что они считают, что наблюдемый эффект – это конечная цель нашего анализа. В таком случае, естественно, возникает желание сделать группы идеально похожими друг на друга. И в целом в этом есть здравое зерно. Оценка в среднем действительно станет ближе к истинному эффекту. Но все ещё необязательно будет ему равна.

Именно поэтому нам важно не получить идеальное совпадение между наблюдаемым и истинным эффектом, а сделать так, чтобы наши оценки обладали нужными статистическими свойствами – точечная оценка была несмещена, а интервальная имела нужный процент покрытия. При обычной рандомизации никаких проблем с этим не возникает.

И, кстати, разъезд ковариат на предпериоде не означает автоматического возникновения ошибки первого рода на периоде эксперимента при отсутствии воздействия. Хотя, конечно, из-за скоррелированности между разностями средних по ковариатам и по целевой метрике такое вполне может быть.

Выше я назвал рерандомизацию уродливой сестричкой стратификации. Это потому что для первой, в отличие от второй, без бутстрэпа сложно посчитать корректную оценку SE. Но по настоящему уродливый член этой семейки – это A/A-тест как проверка валидности эксперимента с онлайн-сплитом. Или A/A/A/A.../B/B/B/B...-тест. Типа подождали 2 недели, набрали нужную выборку, увидели, что ковариата на предпериоде разъехалась, признали результаты A/B невалидными.

В отличие от рерандомизации и стратификации, эта практика никак не может увеличить мощность теста. Более того, она её уменьшает. Влад недавно делал обзор статьи Spotify про применение поправки Бонферрони в тестах с несколькими метриками. Там есть кусочек про Quality metrics. Это метрики, которые при прокрасе сигнализируют нам о том, что что-то с экспериментом не так, и катить фичу по его результатам нельзя (SRM – одна из таких метрик). Каждый + 1 к списку кволити метрик ведет к снижению мощности в широком смысле (вероятность выкатить фичу, если она в действительности удовлетворяет нашим критерям для выкатки). Добавление A/A-проверки – это снижение мощности в обмен на 0 пользы. При корректно работающей сплитовалке прокрасы на предпериоде – статистический артефакт, который никак не ломает инференс.

Поэтому если вы работаете в экс-Леруа Мерлен или в Конструкторе или в каком-нибудь финтехе, в следующий раз при подведении итогов эксперимента сделайте глубокий вдох и сразу перейдите к анализу A/B-теста. А проверку на A/A выпилите нахуй из платформы
  • 👾 18
More from @abtesticles
  1. Jun 24, 2026Джереми Кларксон осваивает бутстрэп https://rutube.ru/video/9b458f07826786d9def20840a74965…
  2. May 26, 2026Гипотезы Статистические критерии устроены таким образом, что они позволяют контролировать…
  3. Apr 21, 2026Мой критический обзор на дизайн байерско-селлерского теста Авито Там предлагается провести…
  4. Mar 29, 2026Может ли одна метрика быть чувствительнее другой Была бы у меня возможность – я бы только…
  5. Feb 20, 2026Post #56
  6. Feb 20, 2026Кейс с собеседования Года полтора назад на собесе в Авито мне дали такой кейс: Тестируем ф…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →