Классика любого курса по A/B — расскажем и про классические экспы, и про Diff in Diff, и про Matching и другие способы провести A/B тесты без A/B тестов
Про эти методы могут и на собесе спросить, и у других аналитиков они точно будут на слуху. Так их нужно знать и применять в итоге?
Давайте разбираться
Есть понятие Causal Inference, а значит оно что-то типо
Область статистики и набор методов, которые помогают нам ответить на вопрос "что произойдет, если мы вмешаемся в физический мир?"
—Как вырастет retention, если дадим клиенту фичу X?
—Заболит ли горло, если переедать мороженое?
—Что было бы, если бы вы не ставили мне реакции на посты? (давайте не проверять)
И так вышло, что A/B тесты — эталонный способ ответить на этот вопрос. Тут есть и рандомизация 🥰 и фиксация начала воздействия🥰 и еще дизайн, выверенный статистикой 🥰 — одним словом, красотень
Ну а что предлагают другие методы? Если супер кратко без подробностей:
🔘Diff in Diff — давайте найдем два похожих тренда и будем влиять только на один. Я раскачу свою фичу в Рязани, а сравнивать буду с Липецком. Оба города оч похожи. Если после раскатки фичи графики в Рязани пошли вверх, то дельта с графиками Липецка — это мой эффект
🔘Matching — давайте найдем похожих людей: скажем, Ваню и Вову. Они одногодки, одного роста, веса, любят кататься на велике и слушать Лану Дель Рэй. Ване подсунем фичу, а Вове нет. А потом по результатам тысяч вань и вов мы оценим эффект нашей фичи.
🔘Synthetic control — я сейчас запущу реактивные электробусы в Москве, и графики поползут вверх. Но с чем сравнить? Я слеплю «двойника» Москвы из взвешенных признаков других городов. Это и будет симуляцией. А разницу между реалом и симуляцией назову своим эффектом.
С вас 5 тыщ и идите используйте? Как бы не так
Несмотря на всю рок-н-ролльность этих методов, у них есть большие изъяны...Все эти идеи построены на больших допущениях
🔵С Diff in Diff мы никогда не узнаем, подмешался ли как-то в наш эффект фестиваль пирогов, который проходил в Рязани после включения нашей фичи. Или может повлияли еще десятки событий, о которых так же мы узнаем только из рязанских пабликов (запоминаем: нарушение parallel trends)
🟡С Matching мы можем попытаться найти похожих людей, но мы же не можем измерить все. Вдруг Ваня решил потрогать фичу, потому что именно он решительный и любопытный, и мы никак об этом не могли знать (запоминаем: unobserved confounders)
🟣А в случае с Synthetic control моя проблема в том, что Москва одна. Я не могу запустить электробусы в тысяче москв и усреднить результат — поэтому всегда остаётся вопрос: а вдруг это просто совпадение?
Эти допущения — это изъяны этих методов. Значит ли это, что мы все равно должны делать только A/B? Снова не все так просто.
Эти методы нам еще пригодятся, но в каких случаях — я напишу в след посте, а то пипец лонгрид получился 😎
Ставьте нашего поваренка аналитика за продолжение 🧑🍳
И мы узнаем, почему иногда нет другого выбора, как отказаться от A/B теста
