У вас команде настроен «процесс А/B тестирования»: все фичи проходят через него, есть крутая А/B-платформа, все метрики считаются, аналитики знают наизусть все стат-критерии, а в прод что-то катится только после «зеленого прокраса».
Есть конечно, маленький шанс ошибки - но умные люди смотрят на p_value, сравнивают с 0.05 - и говорят, риск мал, можно катить. Продуктовая команда браво рапортует в квартальной презентации, "запустили 20 тестов, раскатили 5 фичей, если считать по тестам - даже заработали денег!"
Денег больше не становится, продукт с годами выглядит хуже. Потому что p_value = 0.05 - это не пятипроцентный шанс ошибки.
Сейчас разберемся. Сколько наших гипотез на самом деле являются хорошими? Не по итогам теста (тест может ввести в заблуждение) - а вот по-настоящему, истинно хорошими.
В более-менее зрелых командах True Win Rate (TWR) гипотез на уровне 10% - это очень хороший результат. Заметно больше только в стартапах с совсем под ногами висящими фруктами. На давно устоявшихся частях продукта - меньше
Ок, за годы работы продуктовая команда довела до теста 1000 гипотез, из них 100 (TWR = 10%) были "хорошими", а 900 - "нехорошими". Не обязательно прямо плохими, но видимо продукт не улучшают. Стандартный процесс АБ-тестирования (alpha = 0.05, beta = 0.2) приведет к тому, что на прод раскатят 80 "хороших" - и 45 "нехороших".
45/(80+45) = 36% раскатанного - мусор.
В самых стерильных условиях, где продакт-менеджеры весьма компетентны (TWR аж 10%!) и не "подглядывают" в идущие тесты, аналитики не допускают ошибок, у фичей отсутствует смещение на эффект новизны и никто не заинтересован в искажении результатов - 36% раскатанных изменений не будут помогать продукту. Без стерильных условий, в реальности - доля таких изменений в проде может быть больше 50%.
Вредят ли такие изменения продукту? Отвечать не буду. Предложу представить, что в работающем часовом механизме мы случайно заменяем какие-то детали - и оставляем так, если потом часы пару минут вроде бы идут быстрее. Наверное, с часами все будет в порядке
А как можно делать по-другому - расскажу в следующих постах
Запланировал небольшую серию, буду рассказывать всякие неочевидные вещи про аналитику и принятие решений с ее помощью - из своего опыта за последние 10 лет
Этот пост написан и выстрадан живым человеком, ни одна LLM в процессе не пострадала.
Взято из личного блога Head of Analytics Марка Сысоева в LinkedIn.
Все каналы Партнеркина | #инсайты