TGViewer
Кусочек пиццы | Аналитика данных Кусочек пиццы | Аналитика данных @dataslice · 696 subscribers
Post #117 496
Как статистика применяется в бизнесе?

Недавно получил вопрос от менти: «Я прошла курс, прочитала книгу Сары Бослаф, поняла все принципы и методы. Однако я всё ещё не могу понять, как это всё применять на практике».

Я попробовал разделить все концепции на 3 уровня в зависимости от того, на какой вопрос бизнеса они помогают ответить.

™️Уровень 1. Описать то, что уже произошло

Вопрос бизнеса: как у нас дела и на что смотреть?

Виды распределений.

Любая метрика имеет своё распределение - тысячи наблюдений со своей формой. От этой формы зависит, какой статистический метод сработает корректно.

Меры центральной тенденции.

Среднее, медиана, мода - способ свернуть тысячи наблюдений в одно число, характеризующее метрику. Примеры: средний чек, медианное время обработки заявки, типичное количество покупок на клиента.

Среднее чувствительно к выбросам: на любых метриках с тяжёлым правым хвостом (выручка на клиента, длительность процессов, суммы сделок) оно сдвигается к ним и перестаёт описывать типичное поведение. Поэтому в этом случае часто используют медиану.

Меры разброса.

Дисперсия и стандартное отклонение отвечают на вопрос, насколько данные разбросаны вокруг центра. Практический смысл - предсказуемость.

Два процесса с одинаковым средним, но разным разбросом - это две разные бизнес-ситуации. Средний срок доставки в 5 дней ± полдня и 5 дней ± 4 дня по-разному влияют на точность выводов и прогнозов.

Поэтому снижение дисперсии часто ценнее, чем рост среднего. Бизнес держится на предсказуемости.

Квантили.

Способ описать распределение целиком. Именно на квантилях строятся уровни сервиса - конкретный порог вида «95% запросов обрабатываются быстрее чем за N».

Разница между медианой и 90-м процентилем - это ровно та часть клиентов, у которых опыт заметно хуже. Средним эту группу никогда не увидеть.

™️ Уровень 2. Понять, насколько мы в этом уверены

Вопрос бизнеса: этой цифре можно верить?

Любая посчитанная величина - оценка по выборке. Пересчитайте по другим данным того же процесса - результат будет иным, хотя процесс не менялся. Этот разброс важно уметь измерять.

Точечная оценка и её свойства.

Оценка - функция от выборки, то есть сама случайная величина. От неё требуются несмещённость (в среднем по повторным выборкам даёт истинное значение) и состоятельность (сходится к нему с ростом объёма).

Закон больших чисел обеспечивает состоятельность: среднее по выборке сходится к математическому ожиданию. Это ответ на вопрос, почему увеличение объёма данных вообще что-то даёт.

Центральная предельная теорема описывает форму разброса. Распределение оценки стремится к нормальному независимо от того, как распределена исходная величина.

Отсюда следствие: нормальность нужна для оценки, а данные исходно могут быть распределены как угодно. Условия нарушаются при малом объёме и слишком тяжёлых хвостах.

Стандартная ошибка - стандартное отклонение оценки. Для среднего убывает как корень из объёма выборки: чтобы сузить разброс вдвое, данных нужно вчетверо больше.

Доверительный интервал помогает превратить разброс оценки в конкретный диапазон - границы, в которых лежит истинное значение с заданной вероятностью.

Пример: Конверсия выросла с 4.1% до 4.4%: если интервалы перекрываются, роста нет, есть колебание.

™️ Уровень 3. Проверка гипотез: принять решение при неопределённости

Вопрос бизнеса: мы что-то сделали - стало ли лучше?

Уровень 2 давал единичное число с погрешностью. Здесь нужно принять решение: применять изменение или нет.

Нулевая гипотеза.

Переводит мнение «мне кажется, стало лучше» в проверяемое утверждение. Мы принимаем сторону скептика: различий нет, наблюдаемая разница - случайность выборки.

Бремя доказательства лежит на наличии эффекта. Поэтому нельзя доказать, что тест не навредил, - можно только не найти вреда. Разница принципиальная: «мы не увидели падения» и «падения не было» - разные утверждения, и второе бизнесу обещать нельзя.

p-value.

Вероятность увидеть такое же или большее отклонение, если эффекта на самом деле нет.

Это не вероятность того, что гипотеза верна, и не вероятность ошибиться.

p-value
More from @dataslice
  1. Sep 21, 2026Разбор кейса на тему оценки новой фичи в e-com Это тестовое задание на позицию продуктовог…
  2. Sep 16, 2026Открыта вакансия ко мне команду Ищу к себе в команду маркетингового аналитика. Идеальный к…
  3. Sep 16, 2026Что нас ждёт через несколько лет
  4. Sep 14, 2026photo post
  5. Sep 14, 2026В прошлых постах на тему харнессов мы разобрали теорию: контекст, а также скиллы, инструме…
  6. Sep 10, 2026В линкедине увидел новый термин – «мясной прокси»🥩 Так называют людей, которые просто коп…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →