TGViewer
ЦенСИБ (ex-ЛССИ) ЦенСИБ (ex-ЛССИ) @lcsr_hse · 506 subscribers
Post #517 472

Forwarded from Канал влияния

💎Ценность доказательности: сколько реально стоят A/B‑тесты?

Большие компании вроде Airbnb, Amazon и Google совокупно проводят больше ста тысяч экспериментов в год (Gupta et al., 2019). Но почти никто не знает, сколько денег приносит сама культура экспериментов как элемент доказательного принятия решений (evidence-based decision making, EBDM). В новой статье Альберто Абади, Аниш Агарвал, Хидо Имбенс, Сантьяго Торрес и трое исследователей из Amazon предлагают это посчитать (Abadie et al., 2026)

📈 Ценность доказательств
Авторы вводят показатель Value of Evidence (VoE) – средний прирост целевой метрики от решений по данным – по сравнению с агентом, который решает по среднему эффекту прошлых идей, – за вычетом стоимости экспериментов

Идея:
• есть поток идей (фичи, интервенции, политики)
• можно запускать их сразу или сначала тестировать
VoE показывает, сколько даёт стратегия «сначала измеряем, потом действуем»

При статус-кво «выкатывать все» авторы используют близкий показатель Value of Information under Default adoption (VoID) – ценность информации относительно сценария «запускаем всё подряд»

📊Эмпирический Байес
Каждая идея имеет неизвестный истинный эффект. Эксперимент даёт шумную оценку: больше наблюдений – меньше шум, но дороже тест

Решение «запускать / не запускать» авторы строят не по сырым оценкам, а по ожидаемому эффекту с учётом истории прошлых тестов. Это эмпирический Байес (empirical Bayes): новая оценка «подтягивается» к распределению эффектов, восстановленному из тысяч предыдущих экспериментов (Morris, 1983; Efron, 2010; Abadie et al., 2026)

Так можно посчитать: если бы во всех прошлых экспериментах решения принимались по этому правилу, какой был бы средний выигрыш относительно сценария без данных

🔼Кейс Upworthy
Upworthy – онлайн-медиа, которое в 2010-х делало «виральные» позитивные истории и массово A/B-тестировало связки «заголовок + обложка». Его архив (2013–2015 гг.) – идеальная лаборатория для оценки ценности доказательного подхода

На данных 4,8 тыс. таких тестов:
• средний «сырой» эффект отрицательный – новые варианты в среднем вредят
• разброс огромный: стандартное отклонение оценок (6,03 клика на тысячу показов) почти в восемь раз больше среднего эффекта (-0,76)

При применении байесовского правила отбора VoE и VoID оказываются уверенно положительными: если не запускать всё подряд, а фильтровать идеи на основе анализа истории, система в среднем зарабатывает

🔎Что важнее: точность или разнообразие идей?
Авторы показывают, что:
• увеличение точности оценок (больше данных в каждом тесте) даёт лишь умеренный прирост VoE
• увеличение разнообразия (гетерогенности) и потенциальной силы эффектов (широкое «распределение идей» с редкими большими плюсами и минусами) даёт гораздо больший прирост VoE, а сжатие разброса резко обесценивает данные

Если все идеи «одинаково средние», даже идеальная статистика мало помогает. Если есть редкие очень хорошие и очень плохие идеи, информация становится особенно ценной: она отбрасывает плохие и вытаскивает хорошие

🚫Почему p‑value – плохой советчик для бизнеса?
Типичное правило «запускаем фичу, если эффект положителен и p‑value < 0.05» оказывается экономически неэффективным

На данных Upworthy:
• оптимальное байесовское правило даёт больше VoE
• p‑value‑правило съедает примерно треть потенциальной ценности

Причина: порог по значимости защищает от ошибок I рода, но не максимизирует ожидаемый выигрыш. Он отбрасывает редкие крупные эффекты с шумными оценками и поощряет маленькие, хоть и «надёжные» эффекты. Гораздо важнее не сам факт «значимо/незначимо», а ожидаемый экономический эффект с учётом риска ошибок

Сторонников доказательного подхода часто упрекают в романтизме и том, что они мало говорят о цене высоких стандартов. Работа (Abadie et al., 2026) хороший контрпример. Она показывает, где высокие стандарты действительно окупаются (при большом разбросе эффектов и грамотных правилах решений); а где можно тратить много на эксперименты и почти ничего не выигрывать (когда идеи «гомогенные», а решения принимают по p‑value)

#канал_обозревает
@causal_channel
  • ❤ 13
  • 🔥 3
  • 👏 2
More from @lcsr_hse
  1. Sep 18, 2026Регулярный семинар ЦенСИБ: Никита Зубарев расскажет о влиянии культуры и гражданской морал…
  2. Sep 11, 2026Презентация книги Андрея Щербака: публикуем запись 📹 На регулряном семинаре ЦенСИБ Андрей…
  3. Sep 4, 2026Открываем осенний сезон семинаров ЦенСИБ–2026 🌟 Первым в серии регулярных семинаров этого…
  4. Aug 28, 2026Екатерина Настина – лучший преподаватель 🔥 Опубликованы списки лучших преподавателей Вышк…
  5. Aug 27, 2026Обновление Российской базы бухгалтерской отчетности Мы наконец закончили собирать и провер…
  6. Aug 27, 2026#РББО #ИПП #датасеты Новые данные - это всегда хорошо ☝️
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →