А у нашей вертикали точно всё хорошо?
И вопрос справедливый. Общий эффект может быть положительным, а внутри отдельной вертикали или категории что-то могло просесть.
Самое очевидное решение — посчитать эффект отдельно по всем вертикалям и логическим категориям. Только разрезов обычно много, выборки становятся меньше, а вместе с количеством проверок растёт шанс найти случайную просадку.
Поэтому мы смотрим не только на общий эффект, но и на перцентили total-метрики: от P10 до P90. Так можно понять, не получился ли хороший средний результат за счёт верхней части распределения, пока нижний хвост уехал вниз.
Это, конечно, не ответ на вопрос «в каждой ли вертикали всё идеально?». Скорее ранний сигнал. Если среднее растёт и нижние перцентили ведут себя нормально, причин копать каждый разрез подряд меньше. Если хвост начинает проседать, уже есть повод идти глубже и искать, где именно появилась проблема.
Мне этот подход нравится тем, что он не превращает один эксперимент в десятки отдельных тестов и при этом не оставляет нас с ответом «ну в среднем же всё хорошо».
А как вы проверяете, что хороший общий результат не скрывает проблемы в отдельных маленьких срезах?
