Почему аналитики так любят AБ тесты и в чем проблема ресерчей? 🤔
Недавно закончил один ресёрч и на меня тут навеяло.
Вообще в целом если послушать, почитать исследователей , все кайфуют от рандомизированных экспериментов ( не только в IT) и по максимуму стараются их использовать для проверки своих гипотез (если половине лягушек дать таблетки, они будут прыгать выше ?).
Так почему АБ тесты стараются утилизировать по максимуму ? 🧪Дело в том что рандомизированные эксперименты эта штука которая нас
освобождает от Selection bias( как по мне самый поганый bias), то есть благодаря рандомизации и закону больших чисел , если мы соберем достаточно пользователей то у нас будет «одинаковое» представление в группах каждого фактора который влияет на исследуемую нами метрику. Таким образом единственная разница между двумя группами будет изменение которое мы добавили в тестовую группу.
Но очень часто бывает так что мы не можем провести эксперимент, потому что ,например, хотим понять влияние особенности какой либо группы клиентов на интересующую нас метрику. И тут нам приходится делать «исследование».
Как делается исследование?📊Мы ,например, можем начать подбирать, как мы думаем, идентичных пользователей , где единственное отличие от исследуемых пользователей будет наличие особенности , сравнивать их, и получить какой-то эффект на количество покупок, и на основе этого сделать вывод, что да, исследуемый нами фактор влияет на метрику или мы не можем сказать что он влияет (ну там p-value, конф интервалы, вы меня поняли).
Так в чем же проблема ?🥸
Проблема как раз заключается в том что когда мы делаем те самые подборы похожих клиентов или же добавляем контрольные переменные в нашу регрессию, мы - аналитики делаем это во много исходя из нашего domain knowledge. И как вы понимаете всегда есть вероятность что мы что-то упускаем.
Пример ⁉️
Мы хотим проверить есть ли влияния наличия машины у клиента на количество покупок в нашем сервисе.
Мы подбираем похожих друг на друга клиентов исходя из их возраста , пола , и на самом деле упускаем тот момент в каких городах живут наши клиенты, а этот фактор оказывается значимым для нашей метрики (например люди из Москвы имеют больше машин и по какой то причине покупают больше чем люди из Питера ).
Вуаля , сравниваем группу клиентов с машиной и без , получаем значимое влияние наличие машины на количество покупок. Начинаем привлекать больше людей с машинами в Питере и наша метрика не растет, потраченный маркетинговый бюджет, очередной Lay off 😄
Конечно пример упрощенный, но таким фактором может быть что угодно скрытое от ваших глаз или даже баз данных. Причем
есть ситуации когда принятие во внимание фактора меняет знак эффекта. 😱
Какой вывод из этого надо сделать? 🤔
Качество проводимого вами исследования напрямую зависит от вашего знания доменной области, наука уже придумала ряд методов что бы приблизить качество исследований к условиям рандомизированных экспериментов , но скажем есть куда стремиться.
Рекомендации Для продактов🙋♂️ - если вы видите такого типа исследования как я описал выше, не стесняйтесь, спросите - какие ваш аналитик учел факторы при подборе схожих пользователей? Возможно вы владеете какими то знаниями которые помогут улучшить качество исследования.
Для аналитиков 🤓- перед началом исследования желательно обговорить факторы которые вы принимаете во внимания при анализе, возможно именно эта коммуникация сэкономит денег компании и вам времени.
Вопрос: Кто как справляется с таким родом проблем ?Бонус 🎁 : есть очень крутой эконометрист
Joshua Angrist (человек который придумал Instrumental Variables и получил Нобелевку), вот ссылка на очень понятный его
курс по основам эконометрики, / Causal inference он короткий но в формате кунг фу, наслаждайтесь 😂