Пост-коллаба вообще со всеми
Сережа написал хорошее резюме по стратификации и ее уродливой сестричке рерандомизации. Почитайте, чтобы понимать, о чем речь.
На ахе, кстати, про рерандомизацию рассказывал Ян Пиле из Магнита. И у него на слайде распределение p-value с рерандомизацией при H0 было равномерным, а не скошенным влево, как можно было бы ожидать. Я подошел спросил а че это. Он сказал, что если к рерандомизации прикрутить CUPED, то распределение неожиданным образом выравнивается. В докладе Андрея Романова из Авито, кстати, происходит то же самое. Не чудо ли это? Не чудо – Ян прислал такую статью с разбором этого явления
Обычно с запросом на рерандомизацию приходят по одной из двух причин. Первая – хотят увеличить мощность. Немного сложно сделать в онлайне, проблематично корректно посчитать SE (из-за чего собственно и появляется перекос распределения p-value), скорее всего, не сильно эффективно (по крайней мере, на больших выборках), но в целом ОК.
Но если к вам приходят с запросом на рерандомизацию по причине "разъехались ковариаты на предпериоде, значит результаты невалидны", самое время присесть с человеком и рассказать ему поподробнее о том, как устроена статистика. Мне кажется, что подобные опасения в первую очередь возникают у людей из-за того, что они считают, что наблюдемый эффект – это конечная цель нашего анализа. В таком случае, естественно, возникает желание сделать группы идеально похожими друг на друга. И в целом в этом есть здравое зерно. Оценка в среднем действительно станет ближе к истинному эффекту. Но все ещё необязательно будет ему равна.
Именно поэтому нам важно не получить идеальное совпадение между наблюдаемым и истинным эффектом, а сделать так, чтобы наши оценки обладали нужными статистическими свойствами – точечная оценка была несмещена, а интервальная имела нужный процент покрытия. При обычной рандомизации никаких проблем с этим не возникает.
И, кстати, разъезд ковариат на предпериоде не означает автоматического возникновения ошибки первого рода на периоде эксперимента при отсутствии воздействия. Хотя, конечно, из-за скоррелированности между разностями средних по ковариатам и по целевой метрике такое вполне может быть.
Выше я назвал рерандомизацию уродливой сестричкой стратификации. Это потому что для первой, в отличие от второй, без бутстрэпа сложно посчитать корректную оценку SE. Но по настоящему уродливый член этой семейки – это A/A-тест как проверка валидности эксперимента с онлайн-сплитом. Или A/A/A/A.../B/B/B/B...-тест. Типа подождали 2 недели, набрали нужную выборку, увидели, что ковариата на предпериоде разъехалась, признали результаты A/B невалидными.
В отличие от рерандомизации и стратификации, эта практика никак не может увеличить мощность теста. Более того, она её уменьшает. Влад недавно делал обзор статьи Spotify про применение поправки Бонферрони в тестах с несколькими метриками. Там есть кусочек про Quality metrics. Это метрики, которые при прокрасе сигнализируют нам о том, что что-то с экспериментом не так, и катить фичу по его результатам нельзя (SRM – одна из таких метрик). Каждый + 1 к списку кволити метрик ведет к снижению мощности в широком смысле (вероятность выкатить фичу, если она в действительности удовлетворяет нашим критерям для выкатки). Добавление A/A-проверки – это снижение мощности в обмен на 0 пользы. При корректно работающей сплитовалке прокрасы на предпериоде – статистический артефакт, который никак не ломает инференс.
Поэтому если вы работаете в экс-Леруа Мерлен или в Конструкторе или в каком-нибудь финтехе, в следующий раз при подведении итогов эксперимента сделайте глубокий вдох и сразу перейдите к анализу A/B-теста. А проверку на A/A выпилите нахуй из платформы
Post #60
1.29K

- 👾 18