Темная сторона A/B тестов: разбор квиза
Спасибо всем, кто голосовал и участвовал в обсуждении! На момент публикации поста больше всего голосов против запуска набралось на кейсы: разные цены (40%), специальные поломки приложения (38%) и кнопка о факте голосования (38%), меньше всего волчьи цитаты для мотивации студентов (10%).
А еще 28% запустили бы все, ну вы мощные 😎
Я специально в список кейсов добавила практически обычный A/B тест, но в необычном домене – кейс 2. По факту это вариация на тему красить кнопки, только на сайте предвыборной кампании Обамы 2008 года. Лучший вариант дал +40% к подпискам и, по оценке команды, около $60 млн пожертвований. 16% из нас бы его не запустили, возможно потому что домен нестандартный, а возможно, сработал эффект из статьи в PNAS: A/B тест двух нормальных вариантов люди оценивают хуже, чем внедрение любого из них всем без проверки.
Можно ли как-то формализовать по критериям, какой запуск еще нормальный, а какой за гранью? Я собрала чеклист из главы про этику у Кохави, принципов Belmont Report и практики клинических испытаний:
1️⃣ Неопределённость. Раскатили бы B на всех без теста? Если оба варианта нормальные – тест не хуже релиза.
2️⃣ Риск. Выше ли риск, чем при обычном использовании продукта? Вред остаётся внутри продукта или выходит в жизнь – деньги, работа, здоровье, выборы?
3️⃣ Польза и справедливость. Знание пойдёт на улучшение продукта или станет рычагом против пользователя? Не платит ли одна группа за выгоду другой?
4️⃣ Выбор и честность. Может ли человек отказаться, ожидает ли он такого? Если есть обман – расскажем ли потом?
5️⃣ Данные. Собираем и атрибуцируем только нужную информацию о пользователе и не храним дольше необходимого?
6️⃣ Размер аудитории. Трафик и длительность в соответствии с расчетом мощности, или сколько получится крутим? Есть ли защитные метрики и критерии экстренной остановки?
Теперь по кейсам – это мое ИМХО👇
🟢Этично
Кейс 2, сайт политической кампании. Это окей, хотя домен и необычный. По большинству пунктов чеклиста проходит нормально.
Кейс 3, замедление поиска
Это был Bing, выдачу намеренно замедляли, но вариант B в пределах обычного продукта (так сайт работает при плохом интернете), вред для пользователя небольшой и внутри продукта (2️⃣). Знание по итогу теста пошло пользователям на пользу (3️⃣): оказалось, что каждые 100 мс стоят ~$18 млн в год, и оптимизация скорости стала приоритетом.
Это классический пример ухудшающего теста.
🟡Серая зона
Кейс 1, разные цены.
Amazon в 2000 году продавал DVD диски по разной цене – вред выходит в деньги (2️⃣): одни пользователи платили больше других за один и тот же продукт. Когда это выяснилось, Amazon извинился, вернул разницу почти 7 тысячам покупателей и пообещал в будущих тестах всем минимальную цену (верим? я вот не очень верю).
Кейс 4, мотивация для студентов.
Pearson – сами сообщения безобидны, но студенты не знали о тесте и не могли отказаться: программу назначал курс (4️⃣).
Кейс 6, кнопка я проголосовал.
Это было в Facebook, на выборах 2010 года – к процедуре претензий почти нет: исследование одобрил этический комитет, при сверке с реестрами избирателей в данные намеренно добавили шум ради приватности, а после анализа их удалили. Вопрос в другом: речь о выборах (2️⃣) и 61 млн человек (4️⃣). По оценке авторов, +340 тыс. голосов, очень существенное влияние на явку одной кнопкой.
Кейс 7, рекомендации контактов.
LinkedIn – алгоритм рекомендаций и так постоянно меняют (1️⃣ ок), но вред может повлиять на успешность в карьере (2️⃣), а 5 лет на 20 млн человек (6️⃣) – очень долго. Статья в Science подтвердила теорию слабых связей ценой того, что у части людей шансы найти работу были хуже.
🟣Неэтично
Кейс 5, Facebook, сбои Android (⚠️ по данным The Information, официально не подтверждалось)
Тут прям все плохо: падающее приложение никто не выпустит как продукт (1️⃣), а цель – понять, сколько пользователи стерпят, на случай конфликта с Google Play (3️⃣).
Кейс 8, AI на форуме.
Цюрихский университет, 2025 – боты выдавали себя за людей, в том числе за психолога и пережившего насилие, на форуме, где это прямо запрещено (4️⃣). Этическую экспертизу проходили, но это не помогло: руководитель получил предупреждение, результаты не опубликуют.
Как думаете, почему кейсы 3 и 5, несмотря на то что похожи, попали совсем в разные категории этичности? В случае фейсбука компания намеренно ухудшает свой продукт и не для пользы юзерам. А обычные ухудшающие тесты в целом стандарт индустрии: например, отключение рекомендаций, замедление.
Согласны с моей оценкой, может быть какой-то из кейсов вы бы перенесли в другую группу?
А в комментарии закину, что меня больше всего удивило в процессе подготовки этого материала.
#AB_tests #analytics #stat_fun
Post #251
429
- ❤ 4
- 👍 3
- 🔥 3
- 👎 1
- 😁 1
- 🤔 1