TGViewer
Статистика и R в науке и аналитике Статистика и R в науке и аналитике @stats_for_science · 5.56K subscribers
Post #251 429
Темная сторона A/B тестов: разбор квиза

Спасибо всем, кто голосовал и участвовал в обсуждении! На момент публикации поста больше всего голосов против запуска набралось на кейсы: разные цены (40%), специальные поломки приложения (38%) и кнопка о факте голосования (38%), меньше всего волчьи цитаты для мотивации студентов (10%).
А еще 28% запустили бы все, ну вы мощные 😎

Я специально в список кейсов добавила практически обычный A/B тест, но в необычном домене – кейс 2. По факту это вариация на тему красить кнопки, только на сайте предвыборной кампании Обамы 2008 года. Лучший вариант дал +40% к подпискам и, по оценке команды, около $60 млн пожертвований. 16% из нас бы его не запустили, возможно потому что домен нестандартный, а возможно, сработал эффект из статьи в PNAS: A/B тест двух нормальных вариантов люди оценивают хуже, чем внедрение любого из них всем без проверки.

Можно ли как-то формализовать по критериям, какой запуск еще нормальный, а какой за гранью? Я собрала чеклист из главы про этику у Кохави, принципов Belmont Report и практики клинических испытаний:

1️⃣ Неопределённость. Раскатили бы B на всех без теста? Если оба варианта нормальные – тест не хуже релиза.
2️⃣ Риск. Выше ли риск, чем при обычном использовании продукта? Вред остаётся внутри продукта или выходит в жизнь – деньги, работа, здоровье, выборы?
3️⃣ Польза и справедливость. Знание пойдёт на улучшение продукта или станет рычагом против пользователя? Не платит ли одна группа за выгоду другой?
4️⃣ Выбор и честность. Может ли человек отказаться, ожидает ли он такого? Если есть обман – расскажем ли потом?
5️⃣ Данные. Собираем и атрибуцируем только нужную информацию о пользователе и не храним дольше необходимого?
6️⃣ Размер аудитории. Трафик и длительность в соответствии с расчетом мощности, или сколько получится крутим? Есть ли защитные метрики и критерии экстренной остановки?

Теперь по кейсам – это мое ИМХО👇

🟢Этично

Кейс 2, сайт политической кампании. Это окей, хотя домен и необычный. По большинству пунктов чеклиста проходит нормально.

Кейс 3, замедление поиска
Это был Bing, выдачу намеренно замедляли, но вариант B в пределах обычного продукта (так сайт работает при плохом интернете), вред для пользователя небольшой и внутри продукта (2️⃣). Знание по итогу теста пошло пользователям на пользу (3️⃣): оказалось, что каждые 100 мс стоят ~$18 млн в год, и оптимизация скорости стала приоритетом.
Это классический пример ухудшающего теста.

🟡Серая зона

Кейс 1, разные цены.
Amazon в 2000 году продавал DVD диски по разной цене – вред выходит в деньги (2️⃣): одни пользователи платили больше других за один и тот же продукт. Когда это выяснилось, Amazon извинился, вернул разницу почти 7 тысячам покупателей и пообещал в будущих тестах всем минимальную цену (верим? я вот не очень верю).

Кейс 4, мотивация для студентов.
Pearson – сами сообщения безобидны, но студенты не знали о тесте и не могли отказаться: программу назначал курс (4️⃣).

Кейс 6, кнопка я проголосовал.
Это было в Facebook, на выборах 2010 года – к процедуре претензий почти нет: исследование одобрил этический комитет, при сверке с реестрами избирателей в данные намеренно добавили шум ради приватности, а после анализа их удалили. Вопрос в другом: речь о выборах (2️⃣) и 61 млн человек (4️⃣). По оценке авторов, +340 тыс. голосов, очень существенное влияние на явку одной кнопкой.

Кейс 7, рекомендации контактов.
LinkedIn – алгоритм рекомендаций и так постоянно меняют (1️⃣ ок), но вред может повлиять на успешность в карьере (2️⃣), а 5 лет на 20 млн человек (6️⃣) – очень долго. Статья в Science подтвердила теорию слабых связей ценой того, что у части людей шансы найти работу были хуже.

🟣Неэтично

Кейс 5, Facebook, сбои Android (⚠️ по данным The Information, официально не подтверждалось)
Тут прям все плохо: падающее приложение никто не выпустит как продукт (1️⃣), а цель – понять, сколько пользователи стерпят, на случай конфликта с Google Play (3️⃣).

Кейс 8, AI на форуме.
Цюрихский университет, 2025 – боты выдавали себя за людей, в том числе за психолога и пережившего насилие, на форуме, где это прямо запрещено (4️⃣). Этическую экспертизу проходили, но это не помогло: руководитель получил предупреждение, результаты не опубликуют.

Как думаете, почему кейсы 3 и 5, несмотря на то что похожи, попали совсем в разные категории этичности? В случае фейсбука компания намеренно ухудшает свой продукт и не для пользы юзерам. А обычные ухудшающие тесты в целом стандарт индустрии: например, отключение рекомендаций, замедление.

Согласны с моей оценкой, может быть какой-то из кейсов вы бы перенесли в другую группу?
А в комментарии закину, что меня больше всего удивило в процессе подготовки этого материала.

#AB_tests #analytics #stat_fun
  • ❤ 4
  • 👍 3
  • 🔥 3
  • 👎 1
  • 😁 1
  • 🤔 1
More from @stats_for_science
  1. Sep 24, 2026Этой осенью стартует новый поток курса «Статистика, R и анализ данных» — для биологов, мед…
  2. Sep 23, 2026Post #249
  3. Sep 23, 2026Темная сторона A/B тестов Я вспомнила про рубрику истории A/B тестов (в предыдущих сериях:…
  4. Sep 20, 2026Поведенческая секция: «Расскажите о случае, когда вы не согласились с продактом» Продолжае…
  5. Sep 12, 2026Узнали, согласны? Собрала немного обычных моментов из жизни биолога и A/B тестера, но все…
  6. Sep 1, 2026Коллеги-биостатистики опубликовали статью "Мифологизация статистики в биомедицинских иссле…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →