TGViewer
This is Data This is Data @thisisdata · 6.21K subscribers
Post #176 2.52K
Как аналитики, мы часто натыкаемся на странности в данных. Если о них не знать, то можно сделать неверные выводы. Чтобы не попасть в неудобную ситуацию, я решил осветить некоторые моменты.

Первая уловка статистики кроется в медиане. Это значение, которое делит упорядоченный набор данных на две равные части. В работе мы привыкаем смотреть на вещи под одним и тем же углом. Медиана воспринимается как объективная реальность, а отклонения и выбросы – как погрешности. Тут и поджидает нас демон.

Мы забываем, что медиана – это абстракция, один из вариантов измерения среднего значения. Отклонения же – реальные данные, по которым мы вычисляем среднее.

Я наткнулся на статью 1985 года «The Median Isn't the Message» Стивена Джея Гулда, преподававшего биологию, геологию и историю науки в Гарварде, после прочтения которой перестаешь слепо верить измерениям. Гулд был биологом и понимал сущность статистики. В молодости у него обнаружили рак. Медианная продолжительность жизни с его диагнозом составляла 8 месяцев. Отойдя от шока, Гулд обратился к науке. Он проанализировал статистику по заболеванию и поверил в то, что переживет медиану. Так и оказалось – с диагнозом мезотелиома брюшины он прожил еще 20 лет, что превышает медианное значение в 30 раз!

На что обратил внимание Гулд?

1️⃣ Ассиметричное правостороннее распределение

При таком распределении график скошен вправо, а его хвост тянется достаточно далеко. При этом медиана меньше среднего значения:
мода < медиана < среднее

Вытянутый вправо хвост, пусть и тонкий, указывал на наличие больных, которые прожили на несколько лет дольше 8 месяцев. И Гулд имел хорошие шансы оказаться в этой части распределения.

2️⃣ Обстоятельства

Анализировать данные следует исходя из контекста. Если он меняется, то меняется и интерпретация данных.

На продолжительность жизни онкобольных влияет лечение, стадия выявления рака, возраст пациента и его мотивация жить. В этом плане Гулду повезло – рак был выявлен на ранней стадии. То, что он был молод, начал проходить экспериментальное лечение, а также задал правильные вопросы и нашел правильные ответы, помогло ему обрести уверенность и оказаться в самом хвосте распределения.

Пример Гулда показывает, что любое среднее – это в первую очередь абстракция. При интерпретации данных мы должны учесть их распределения, отклонения и контекст.

#аномалии
  • 👍 22
  • ❤ 6
  • 🤔 5
More from @thisisdata
  1. Sep 8, 2026Продукты 24 12 сентября в Москве Т-Банк собирает конференцию Продукты 24 x ffdd2d в компле…
  2. Sep 1, 2026День знаний, или Я все еще студент Лето опять пролетело подозрительно быстро. Я не успел н…
  3. Aug 25, 2026Обновил телеграм-курс по метрикам Уже несколько лет я разбираю метрики в канале: фреймворк…
  4. Aug 17, 2026AI в работе. Что изменилось? Почти два года назад я написал пост «Когда тебя заменит робот…
  5. Aug 7, 2026На русском языке о стратегии построения аналитической команды нет почти ничего. Буквально…
  6. Jul 15, 2026Как написать стратегию аналитики и зачем она нужна? Ура, я наконец-то закончил эту статью!…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →