Во время A/B-тестов мы обычно смотрим на метрики в двух срезах: по всем участникам эксперимента (left join) и только по активным пользователям (inner join). Проблема в том, что аудитория эксперимента может составлять миллионы человек, а целевые действия совершает лишь малая часть. Считать тяжёлые статистики по всем участникам в Spark — долго и дорого из-за огромного количества нулей.
⏭️ Наша коллега из Райдтеха Диля Хакимова нашла изящное математическое решение, как вообще не считать left join на кластере, а получать его за доли секунды из данных inner join.
👳 В карточках коротко описали суть проблемы и решения, а о реализации для
ttest и bootstrap расскажем в следующих постах.Подписывайтесь:
💬 @Yandex4Analytics





