TGViewer
Channel Public Channel
AB тесты и все вот про это вот все

AB тесты и все вот про это вот все

@abtesting_full

Полезная информация об A/B тестировании. По любым вопросам можно писать - @ealexandr
Subscribers
1.87K
Photos
26
Videos
1
Links
258

Showing posts older than #170 · Back to latest

Older Posts 20 shown
Post #167 494
Немного о делении трафика для АБ теста. То, что чем ближе деление трафика к равномерному, тем лучше, всем известно. Мне захотелось посмотреть на это визуально.
Построил два графика. Первый показывает зависимость продолжительности теста от равномерности деления трафика, другой - зависимость мощности от деления трафика.

Для построения первого графика взяты показатели:
- текущая CR 30%
- необходимый uplift конверсии 7%
- pvalue 0.05
- несколько вариантов деления трафика 0.5, 0.55, 0.6, 0.65, 0.7, 0.75, 0.8, 0.85, 0.9, 0.95, где 0.5 это 50%/50%, 0.95 - 95%/5%
И получилось, что после деления трафика больше 0.8 кривая уже очень сильно ползет вверх.

Для построения второго графика взяты показатели:
- текущая CR 6%
- получившийся uplift конверсии 5%
- pvalue 0.05
- количество пользователей в тесте 300 000
- такие же варианты деления трафика 0.5, 0.55, 0.6, 0.65, 0.7, 0.75, 0.8, 0.85, 0.9, 0.95, где 0.5 это 50%/50%, 0.95 - 95%/5%
Здесь видим подобную картину, что при делении трафика больше 0.8 кривая уже очень сильно ползет вниз и пересекает нужный показатель мощности 0.8. Т.е., получая одни и те же результаты эксперимента, мы все меньше можем им верить, несмотря на то, что pvalue 0.05 и все вроде бы хорошо.

Понятно, что в каждом тесте будут свои цифры и кривые, но графики будут похожи. Вполне себе аргумент поторговаться перед запуском теста за приближение деления трафика к равномерному.
Post #166 508
AB тесты и все вот про это вот все Написал небольшой калькулятор для рассчета продолжительности теста. Он повторяет калькулятор Эвана Миллера и пока работает только для равного деления трафика и одного тестового варианта. Но немного экономит времени https://github.com/a-efimov/Pre-Calculate…
Выложил второй ноутбук, со вторым калькулятором. Он называется Pre Calculate AB tests ratio. Может рассчитывать объем трафика для тестов с неравным делением трафика. Уверен, такие эксперименты не только у меня происходят.
https://github.com/a-efimov/Pre-Calculate-AB-test
GitHub GitHub - a-efimov/Pre-Calculate-AB-test Contribute to a-efimov/Pre-Calculate-AB-test development by creating an account on GitHub.
Post #165 468

Forwarded from Аналитика. Это просто

Почти все калькуляторы для АБ тестов - черные ящики: в них засовываешь параметры, получаешь некий результат. И не видно, что и как рассчитывается. Многие знают про калькулятор размера выборки АБ теста от Эвана Миллера. Код, по которому работает этот калькулятор: https://gist.github.com/mottalrd/7ddfd45d14bc7433dec2
Gist Evan Miller source code for sample size from my blog post http://www.alfredo.motta.name/ab-testing-from-scratch/ Evan Miller source code for sample size from my blog post http://www.alfredo.motta.name/ab-testing-from-scratch/ - gist:7ddfd45d14bc7433dec2
Post #164 404

Forwarded from Trisigma — про эксперименты

Как измерить влияние социального эффекта в A/B-тесте?

В нашем блоге вышла новая статья! Мы уже неоднократно рассказывали про социальные эффекты на митапах и конференциях, а также публиковали статьи про Switchback-эксперименты вместе с нашими друзьями из Ситимобил.

Борьба с социальными эффектами в экспериментах обладает своими особенностями. Во-первых, в каждом эксперименте должно соблюдаться предположение о том, что изменения в тесте воздействуют только на тестовую группу, а на контроль нет (SUTVA). Во-вторых, чтобы эта борьба не была напрасной, необходимо каким-то образом замерять влияние соц. эффекта. Это не так очевидно, как может показаться на первый взгляд.

Ксения Мензорова (DS Маркетплейса Ситимобил) сделала разбор статьи от LinkedIn, где приводится методика по определению влияния соц. эффекта в экспериментах

Читать на медиуме
Post #163 382
Написал небольшой калькулятор для рассчета продолжительности теста. Он повторяет калькулятор Эвана Миллера и пока работает только для равного деления трафика и одного тестового варианта.
Но немного экономит времени
https://github.com/a-efimov/Pre-Calculate-AB-test
GitHub GitHub - a-efimov/Pre-Calculate-AB-test Contribute to a-efimov/Pre-Calculate-AB-test development by creating an account on GitHub.
Post #161 358

Forwarded from karpov.courses

В материале выше разобрано бакетное преобразование метрики – этот метод очень часто применяется в промышленном A/B-тестировании. В материале коллег из ВКонтакте разбираются выборки длины 5000, попробуйте увеличить размер выборки, например, до 10000, а затем поварьируйте количество бакетов (скажем, от 10 до 100 с шагом в 10), чтобы проследить, как с изменением количества бакетов меняются (и меняются ли) чувствительность теста и контроль \alpha за false positive rate. Кроме того, над результатами бакетного преобразования можно запустить тест Манна-Уитни. Проверьте, как будут меняться чувствительность и контроль в зависимости от количества бакетов для теста Манна-Уитни. Также стоит поварьировать скошенность распределений просмотров и истинных CTR. Посмотрите, используя полученные данные, в каких пределах работает бакетное преобразование.

Если вы смогли самостоятельно провернуть все действия выше – поздравляем, вы освоили новый метод! Если нет – вебинар состоится 17 июня в 19:00.

Еще раз приносим свои извинения, и спасибо, что вы нас поддерживаете!
Post #160 322

Forwarded from karpov.courses

Мы не смогли победить интернет в студии, но даже технические неполадки – не помеха на пути к знаниям!

Во-первых, вебинар базируется на статье «Dealing With Ratio Metrics in A/B Testing at the Presence of Intra-User Correlation and Segments».

Во-вторых, применение анонсированного метода, а также многих других, к задаче анализа тестов над метриками-отношениями можно подсмотреть в материале коллег из ВКонтакте.
Post #159 308

Forwarded from Trisigma — про эксперименты

Switchback-эксперименты в Ситимобил. Часть 1

Наши друзья из команды динамического ценообразования Ситимобил написали подробную статью про работу Switchback’а в их компании, тем самым начав серию статей посвященных этому особому способу сплитования.

Switchback – метод сплитования групп, где единицей рандомизации является не пользователь, а бакет по признакам гео и времени. Благодаря чему удается нивелировать социальный эффект и тем самым исключить влияние тестовой группы на контрольную.

EXPF также принимали участие в проекте по разработке свитчбэка в Ситимобиле. В команде Ситимобила работают сильные специалисты и поэтому не было ни минуты сомнения, что свитчбэк «взлетит».

Читать статью на Хабре
Post #157 283

Forwarded from Trisigma — про эксперименты

Как считать A/B, когда у вас зеттабайты данных? Что?!

В новой статье Microsoft подробно описывают трюки, которые позволят считать эксперименты на зеттабайтах данных (1зб = 1000 тб). На случай, если у вас вдруг где-то завалялось несколько винчестеров, статья будет полезна в решении задачи (ну мало ли)

Читать статью
Microsoft Research More Trustworthy A/B Analysis: Less Data Sampling and More Data Reducing - Microsoft Research You need to reduce data volume to save cost of storage and computation. But are you mindful of its impact on the analysis for A/B tests? Do you still have valid and sensitive metrics? Are you confident the A/B analysis is still trustworthy so that you can…
Post #156 307
Есть часто встречающаяся проблема при проведении АБ тестов - неравномерное деление трафика, например, 80%/20% или 90%/10%. Конечно, этого лучше избегать, но не всегда это возможно. Спланировать продолжительность теста в таком случае - тоже проблема. Распространенный калькуляторы предполагают, что трафик будет делиться поровну.
Статьи про особенности АБ тестов с неравным делением трафика и ссылка на калькулятор:
- https://bit.ly/3aQLRkY
- https://bit.ly/2S9G6HN
- https://www.statsig.com/calculator
Medium Дисбаланс в A/B-тестах. Есть ли разница между 99%/1% и 50%/50% в экспериментах? Итак, по какой-то причине вы или ваша команда решили запустить A/B-тестирование с несбалансированными выборками (например, 65/45, 90/10…
Post #154 282
И еще вебинар с отличными спикерами: Романом Поборчим, Валерием Бабушкиным, Искандером Мирмахмадовым, Данилой Леньков, Еленой Швец. https://www.youtube.com/watch?v=4yX3dBD8RcI
Post #152 261

Forwarded from Trisigma — про эксперименты

Beyond Power Analysis: Metric Sensitivity in A/B Tests

У Майков пару дней назад вышла новая статья про оптимизацию чувствительности метрик!

В статье описываются уже известные методики по работе с метрикой (например, логарифмирование или использование техники сокращения дисперсии), но зато коротко, ясно и понятно. Помимо этого, в статье описано то, как вы можете использовать исторические эксперименты для получения знаний о направленности метрики.

https://www.microsoft.com/en-us/research/group/experimentation-platform-exp/articles/beyond-power-analysis-metric-sensitivity-in-a-b-tests/
Microsoft Research Beyond Power Analysis: Metric Sensitivity Analysis in A/B Tests - Microsoft Research A/B test is commonly used to measure a feature impact. How can you maximize the chance of detecting an effect when there is one? How can you increase the confidence that there is no treatment effect when the metrics have no stat-sig movement?
Post #150 268
Post #149 254
Иногда требуется рассчитать стат. значимость прямо в BigQuery для отчета в Data Studio. Мне недавно пришлось это делать. Помощь подоспела: https://towardsdatascience.com/google-datastudio-dashboard-how-to-add-a-b-test-significance-level-in-5-minutes-8b839f28a332
Medium Google DataStudio dashboards: how to add A/B test significance level in 5 minutes For those who display A/B tests in Google DataStudio, there is an easy way to integrate significance level. No need to use an external…
Post #147 261

Forwarded from Datalytics

Ребята из EXPF подготовили отличный перевод статьи про методику проведения экспериментов Switchback. Эта техника тестирования полезна в условиях сильного влияния наблюдений (например, таксистов, курьеров или потребителей) друг на друга — эту проблему еще называют как “социальный эффект” или Network Effect.

В Ситимобил уже успешно внедряется свитчбэк-тестирование. В конце статьи вы можете прочитать комментарий об их опыте и впечатления от использования свитчбэка из первых уст.

Switchback-тестирование. Как бороться с социальными эффектами в A/B-тестах

16 марта у EXPF стартует интенсив «Математическая статистика и A/B-тесты», где будут на практике рассмотрены основные методологические и математические проблемы A/B тестирования. Этот интенсив будет полезен всем, кто хочет начать разбираться в теме и начать проводить A/B тесты так, чтобы их результатам можно было доверять.
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →