💎
Ценность доказательности: сколько реально стоят A/B‑тесты?Большие компании вроде Airbnb, Amazon и Google совокупно проводят больше ста тысяч экспериментов в год (Gupta et al., 2019). Но почти никто не знает, сколько денег приносит сама культура экспериментов как элемент доказательного принятия решений (evidence-based decision making, EBDM). В новой статье Альберто Абади, Аниш Агарвал, Хидо Имбенс, Сантьяго Торрес и трое исследователей из Amazon предлагают это посчитать (Abadie et al., 2026)📈
Ценность доказательствАвторы вводят показатель
Value of Evidence (VoE) – средний прирост целевой метрики от решений по данным – по сравнению с агентом, который решает по среднему эффекту прошлых идей, – за вычетом стоимости экспериментов
Идея:
• есть поток идей (фичи, интервенции, политики)
• можно запускать их сразу или сначала тестировать
VoE показывает, сколько даёт стратегия «сначала измеряем, потом действуем»
При статус-кво «выкатывать все» авторы используют близкий показатель
Value of Information under Default adoption (VoID) – ценность информации относительно сценария «запускаем всё подряд»
📊
Эмпирический Байес Каждая идея имеет неизвестный истинный эффект. Эксперимент даёт шумную оценку: больше наблюдений – меньше шум, но дороже тест
Решение «запускать / не запускать» авторы строят не по сырым оценкам, а по ожидаемому эффекту с учётом истории прошлых тестов. Это эмпирический Байес (empirical Bayes): новая оценка «подтягивается» к распределению эффектов, восстановленному из тысяч предыдущих экспериментов (
Morris, 1983;
Efron, 2010;
Abadie et al., 2026)
Так можно посчитать: если бы во всех прошлых экспериментах решения принимались по этому правилу, какой был бы средний выигрыш относительно сценария без данных
🔼
Кейс UpworthyUpworthy – онлайн-медиа, которое в 2010-х делало «виральные» позитивные истории и массово A/B-тестировало связки «заголовок + обложка». Его архив (2013–2015 гг.) – идеальная лаборатория для оценки ценности доказательного подхода
На данных 4,8 тыс. таких тестов:
• средний «сырой» эффект отрицательный – новые варианты в среднем вредят
• разброс огромный: стандартное отклонение оценок (6,03 клика на тысячу показов) почти в восемь раз больше среднего эффекта (-0,76)
При применении байесовского правила отбора VoE и VoID оказываются уверенно положительными: если не запускать всё подряд, а фильтровать идеи на основе анализа истории, система в среднем зарабатывает
🔎
Что важнее: точность или разнообразие идей?Авторы показывают, что:
• увеличение точности оценок (больше данных в каждом тесте) даёт лишь умеренный прирост VoE
• увеличение разнообразия (гетерогенности) и потенциальной силы эффектов (широкое «распределение идей» с редкими большими плюсами и минусами) даёт гораздо больший прирост VoE, а сжатие разброса резко обесценивает данные
Если все идеи «одинаково средние», даже идеальная статистика мало помогает. Если есть редкие очень хорошие и очень плохие идеи, информация становится особенно ценной: она отбрасывает плохие и вытаскивает хорошие
🚫
Почему p‑value –
плохой советчик для бизнеса?Типичное правило «запускаем фичу, если эффект положителен и p‑value < 0.05» оказывается экономически неэффективным
На данных Upworthy:
• оптимальное байесовское правило даёт больше VoE
• p‑value‑правило съедает примерно треть потенциальной ценности
Причина: порог по значимости защищает от ошибок I рода, но не максимизирует ожидаемый выигрыш. Он отбрасывает редкие крупные эффекты с шумными оценками и поощряет маленькие, хоть и «надёжные» эффекты. Гораздо важнее не сам факт «значимо/незначимо», а ожидаемый экономический эффект с учётом риска ошибок
Сторонников доказательного подхода часто упрекают в романтизме и том, что они мало говорят о цене высоких стандартов. Работа (Abadie et al., 2026) хороший контрпример. Она показывает, где высокие стандарты действительно окупаются (при большом разбросе эффектов и грамотных правилах решений); а где можно тратить много на эксперименты и почти ничего не выигрывать (когда идеи «гомогенные», а решения принимают по p‑value)#канал_обозревает
@causal_channel