🔵 Предлагаю вам взглянуть на пейпер Airbnb про interleaving.
Проблема
Airbnb улучшает поиск по жилью, метрики у них конверсионные, вплоть до бронирования. Бронируют редко, куда реже, чем кликают в обычном e-commerce. Значит A/B нужно много трафика и много недель, а идей по ранжированию всегда больше, чем свободных слотов под тесты. В классических A/B физически сложно это все уместить.
Что предлагают авторы
Пользователей не делят на контроль и тест. Выдачу двух ранкеров смешивают и показывают одному человеку сразу, поэтому сравнение идёт внутри одного пользователя, а не между группами.
Смешивают через team drafting. Т.к. пользователю мы показываем результаты обоих ранкеров, то все что делает сплиттер, это рандомизация порядковых номеров для каждого элемента в выдаче (AABABB, BABBAB и т.п.)
Победителя определяют по preference margin и обычному одновыборочному t-тесту.
Когда это реально нужно
Когда узкое горлышко именно в A/B: много гипотез по ранжированию или рекомендациям, и при этом мало трафика или редкая конверсия. У Airbnb interleaving дал 50x ускорение, эксперимент забирает около 6% A/B-трафика и треть длительности, а с A/B сходится в 82% случаев. По сути это способ дёшево отсеять слабые идеи до полноценного теста.
От себя
Interleaving это не замена A/B, а предварительный фильтр для полноценного A/B. Он меряет относительное предпочтение между двумя ранкерами, а не абсолютный прирост бизнес-метрики. Разработка и интеграция tdi достаточно дорогостоящее занятие, поэтому к этой практике имеет смысл переходить только тогда, когда количество АБ над ранжированием достаточно емкое.
Trisigma — канал про A/B-тестирование
#trisigma