TGViewer
A/B-тестирование в мобильных играх A/B-тестирование в мобильных играх @abtestingmobilegames · 430 subscribers
Post #20 697
​​Что мы делаем, когда разработчики заняты

Порой разработчики длительно заняты большой задачей. Например, 3 недели назад мы начали пилить крупный апдейт, который займет примерно месяц. Раньше мы сильно переживали, что игроки надолго остаются без апдейтов. Учитывая, что много апдейтов мы откатываем, можно загрустить.

Сейчас вместо того чтобы торопить разработчиков и срывать нервы, мы:
1. Запускаем тесты на баланс (об этом было подробно в прошлых статьях).
2. Запускаем тесты на удаление фич.

Пункт 2 - наш самый любимый. Запустить его можно очень дешево, а эффект бывает как от дорогой фичи. Рассмотрим пример. В нашей многоуровневой tower defense игре Island Defense есть механика Survival. Крипы вылезают из всех щелей, надо продержаться как можно дольше, чем дольше продержишься, тем больше приз.

Шаги эксперимента:

1. Делим игроков на две группы: контрольная получает версию с фичей (“есть survival”), вторая - без фичи (“нет survival”).

2. Скармливаем данные о покупках и показах рекламы нашей платформе (рассмотрим далее на примере показов).

3. Платформа считает показы для каждого игрока в двух группах: Игрок 2346 - 5 показов, Игрок 5435 - 7 показов, …

4. Собираются данные на 2000-4000 игроков. По предыдущему опыту мы знаем, что примерно на таком количестве наши тесты “красятся”, т.е. платформе достаточно данных для выдачи заключения.

5. Платформа строит распределение разницы средних значений показов через бутстрап. Возможно, страшно прозвучало сейчас :) Бутстрап - это тема отдельной статьи, но если говорить совсем просто, то это моделирование подсчета среднего значения на основе существующих данных. Или еще проще: бутстрап показывает, как могло бы выглядеть среднее на наших данных, если бы они были немного другими.

На графике в этом примере:
1. 95% доверительный интервал разницы находится ниже 0. На человеческий язык это переводится так: “Со значительной степенью уверенности можно говорить, что разница есть”.
2. Границы доверительного интервала: -1.17, -4.64. И опять в переводе на человеческий язык: “Увеличение составляет от 1.17 до 4.64 показа на игрока”.

Ура! Времени потрачено мало, а эффект большой! Выпиливаем survival, чтобы показывать еще больше рекламы игрокам.

Честно говоря, мы показали хороший сценарий, что происходит редко. В большинстве случаев мы не ждем, что выпиливание фичи даст результат. Но когда разработчики заняты, и интересный эксперимент запустить не получается… Почему бы не выпиливать фичи?
More from @abtestingmobilegames
  1. Aug 28, 2024От нас долго не было ничего слышно, но мы каждую неделю продолжаем запускать AB-тесты 🙂 С…
  2. Jun 29, 2021Как же мы устали от тестовых платежей. Многие наши эксперименты не красились из-за тестовы…
  3. Jun 3, 2021DevGamm опубликовал нашу лекцию "Как проводить эксперименты в мобильных играх". 1. Техниче…
  4. Jun 1, 2021Ron Kohavi в книге Trustworthy Online Controlled Experiments перечисляет типы архитектуры…
  5. May 25, 2021CUPED - это технология, которая увеличивает чувствительность А/Б экспериментов. Booking и…
  6. May 18, 2021​​Ron Kohavi в книге Trustworthy Online Controlled Experiments приводит приблизительную фо…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →