Я сначала решил скопипасть весь пост из блога, но оказалось, что такой объем для tg - это охереть какой лонгрид. Ниже саммари, ни одна LLM не пострадала. Смотрим пост выше, читаем и смотрим комменты.
tldr;
A/B-тесты часто проводятся неправильно из-за когнитивных искажений и ограничений инструментов. Решения на основе таких тестов низкого качества. A/A-тесты - это простой инструмент, который повышает качество решений на базе A/B-тестов и позволяет очень просто понять, сколько нужно трафика для тестов.
Часто вижу, что A/B проводятся некорректно. Это не считая того, что A/B-тесты - далеко не идеальный инструмент. Посмотрим, что не ок.
Что за A/B?
Ставим рядом ленды, офферы, объявления и проверяем, что из них работает лучше. Важно: ставим одновременно.
Сравниваем целевую метрику, для арбитража - это деньги или производные: revenue, profit, ROI, EPV.
Зачем? Партнерский маркетинг про эксперименты. Эксперименты нужны правильные, иначе решения - говно.
Эксперименты проводить сложно, даже если кажется, что нет: что считать гипотезой, вариантом и целевой метрикой, как сравнивать, сколько трафика надо, как не пропустить скрытые факторы.
Отвечаем на вопрос: сколько надо трафика. Есть инструменты типа многоруких бандитов, бейесовских тестов, CUPED. Они надежнее, но усложняют эксперименты, требуют технического решения и понимания, как проводить.
Что болит для меня: баеры не верят, что принимать решение на 20-30 конверсиях (да и на 50-100) - плохая идея. Не верят и все тут. Ну вот же, все видно: по 500 кликов на ленд, тут 17 конверсий, а тут 11. Понятно же, кто победитель, чего ты пристал, ну. Обычная история и не только в партнерском маркетинге. С офферами, как правило, все немного иначе.
Почему так? Потому что random - страшная сила, а люди не умеют в интуитивное восприятие вероятностей.
Что такое А/А-тест?
Это когда вы ставите два безнадежно одинаковых варианта.
Поставили, что дальше? Ждем, что варианты покажут одинаковый результат. Дальше происходит удивление. Например, всего 200 конверсий и разница 20%, на одинаковых вариантах, как же так?
Вот так: случайность сильна, выборка мала, трафик неоднороден.
Кроме этого в таких тестах, надо думать об офферах. Круится за лендами в сплите еще 3 оффера - возможно у вас уже A/B/C/D/E/F тест.
Расхождения все равно будут почти всегда, нормально, если у вас расхождение 3-5% на А/А-тесте на сотнях конверсий, если расхождение больше - что-то идет не так.
Зачем нужны A/A?
- A/B - сложнее, чем кажется
- У людей когнитивные искажения
- Тестировать надо правильно
Как работает (упрощенно):
- ставим A/A/B тест
- льем, пока, A/A-варианты не сойдутся
- эмпирически и относительно надежно понимаем, когда налили достаточно
Плюсы:
- легко настроить
- позволяет поймать сломанный трекинг и скрытые факторы
Минусы:
- На старте A/A вариант может сойтись слишком быстро, что часто случайность
- Нужно больше трафика
Чеклист А/А/B-тестов:
- Сначала делаем A/A-тесты для базового уровня: 2-3 АА-теста, 200 конверсий на вариант, расхождение < 5%
- А/А/B-тесты в равном соотношении:
- 10-15 конверсий на A и нет конверсий на B - проверяем трекинг и льем дальше
- 50 конверсий, разница 2-3 раза - проверяем трекинг, льем 10-15 конверсий и останавливаем
- 100 конверсий, разница больше 50% - надо останавливать
- Новые гео, продукт, оффер - новый тест
- Ухудшающий результат - останавливаем, улучшающий проверяем на x2-x3
- Тест проходит в одинаковых условиях
- Желательно льем неделю, но редко кто столько терпит
- Варианты ставятся одновременно
- Оставляем A/A на основе победителя
По опыту, если A/B офферов, то все количества из рекомендаций выше можно сократить в два раза.
Важно: инструмент - не 100% гарантия качественного теста, но намного лучше, чем просто A/B на глаз или с калькулятором стат значимости.
Закончить чтение поста с ощущением некоторого недоверия - это ок. Не верьте мне, пробуйте сами.
Post #7
1.2K
- 🔥 2
- 👍 1