🐱 Бутстрап или как оценить неопределенность в данных.
Всем привет! В этом посте затронем бутстрап, рассмотрим основные аспекты и ограничения.
😼 Этот метод позволяет построить эмпирическое распределение статистики на основе имеющейся выборки (как правило, мы работаем именно с ней).
Стандартный алгоритм выглядит следующим образом:
1️⃣ Берём выборочное распределение метрик, из которых впоследствии мы будем строить распределение статистики (среднее, n-ый квантиль и др.)
2️⃣ Выбираем количество бутстрап-итераций, т.е. сколько мы раз будем генерировать подвыборку
3️⃣ Семплируем подвыборку с возвращением ровно столько раз, сколько элементов в изначальной выборке
4️⃣ Повторяем это n раз, указанных на 2 шаге
5️⃣ Получаем распределение статистики.
🍦 Что это означает для нас?
То, что мы можем оценивать доверительные интервалы для статистик (обычно в индустрии используют разницу между двумя статистиками), использовать более сложные метрики для анализа (например, Ratio-метрики), рассчитать p-value и сделать какие-то выводы.
К ограничениям я бы отнес следующее:
❓ Бутстрап предполагает независимость данных, поэтому какие-нибудь метрики по типу: отношение роста к весу на людей не подойдет. Нарушаются предпосылки о независимости случайных величин.
⌛ Сложность вычисления на большой выборке пользователей. Да, создать генератор случайных величин - это классно. Но что имеем по факту? Многомиллионные A/B тесты, которые обсчитываются очень долго и командам остается либо придумывать варианты, связанные с параллелизмом расчетов, либо воспользоваться другим тестом для оценки изменений.
📚 Полезные материалы по теме:
https://habr.com/ru/amp/publications/679842/
https://habr.com/ru/amp/publications/762648/
😇 Понравился пост? Ставьте реакции, пишите комментарии, а я напишу в дальнейшем про виды бутстрапа
UPD. Предпосылка бутстрапа:
Разница между статистикой, вычисленной по случайной выборке, и статистикой, вычисленной по генеральной совокупности, должна аппроксимироваться разницей между статистикой, вычисленной по случайной выборке, и статистикой, вычисленной по выборке с возвращением из этой случайной выборки
Post #202
2.72K
- 🔥 22
- ❤ 8
- 👍 1