В продолжении про MDE, несколько слов о его сводного брате, о "Желаемом эффекте".
Дело в том, что формуле размера выборки для A/B в рамках t-test'a стоит следующее (среднее А минус среднее B). Но когда у нас есть доступный размер аудитории, альфа и мощность мы можем оценить именно то, что и называется MDE: какой минимальный эффект в лице разниц среднего А и среднего B мы можем обнаружить при заданных параметрах и доступной аудитории.
Подсчитали? Прекрасно, теперь у нас есть MDE как одно из двух лиц "среднее А минус среднее B"
Другое лицо это - Желаемый эффект.
Желаемый эффект - это оценка прироста, которую бизнес ожидает от своей гипотезы.
На чем строиться это оценка? Чаще всего "нам так кажется". Это на самом деле не так плохо, так как:
- во-первых, нельзя сбрасывать со счетов экспертизу людей
- во-вторых, трудность оценки возможного эффекта. Делать это более взвешенно куда сложнее, чем кажется. Как правило, требует какую-то историю исследований и тестов, сбор фактов, анализ исследований по индустрии; то есть подсчитает за день-другой не выйдет. При этом представьте: это надо делать по каждой гипотезе.
Поэтому "нам так кажется" это норма в бизнесе, нравится или нет: он двигается иначе, чем НИИ.
Что мы делаем с этим Желаемым Эффектом? А все довольно просто: смотрим, больше или меньше он MDE, от этого мы сразу понимаем и мощность по него нашего теста. Проблема возникает в случае, если MDE больше этого эффекта, у эффекта меньше мощность, чем мы планируем. Один из вариантов (помимо изменения альфы и увеличения размера выборки - последний предпочтительнее, но не всегда возможен) остановится Желаемом эффекте = MDE. То есть пытаться отловить эффект больше. И вот слово "больше" как будто бы хорошо, да?
Ведь раз мы говорим за бизнес, то возникает вполне резонный вопрос: "Разве больший эффект это не то, что нужно бизнесу?" Конечно, да, вложить 1 рубль и получить с него 100 рублей это ж милое дело. Так зачем нам получать 50, если можно 100?
Но дело в том, что развитие редко принимает скачкообразную форму, это скорее постепенное движение от одного маленького улучшения к другому. Большой эффект же вообще явление редкое, маловероятное: то есть хоть его и мощность как вероятность обнаружить, где он реально есть, большая, но сам он - маловероятный, а потому он сомнителен сам по себе в качестве проверяемого. То есть закладывать такой эффект = скорее всего, не меняться, так как в подавляющем большинстве случаев результат не будет стат. значимым (помним, что у нас автоматом будет аудитория меньше), а значит B будет постоянно не внедряться.
Поэтому и стараются отловить как можно меньше эффект, зная, что все нововведения улучшают все же по чуть-чуть, но с поправкой на практическую значимость (где эффект от внедрение окупит стоимость внедрения) - это позволяет постепенно менять продукт, выжимая то там, то сям пару пунктов, может и пару процентов. И вот ты зарабатывал 100 млн., а стал через год уверенно 120 млн. А ожидая большой эффект можешь так-то и начать проигрывать конкурентам, ничего не меняя.
Определенно, какая-то гипотеза имеет право быть революционной, но если они у вас все такие, то имеет смысл приглядеться к тому, а как это так получается, и что-то менять, потому что у вас повышается риск остаться без изменений, а значит в перспективе - экскрементами мамонта.
Post #12
542