Когда мы проводим разведочный анализ данных (англ. Exploratory Data Analysis, EDA), то обязательно визуализируем их на определенном этапе: строим диаграммы, графики и карты. Можно ли пропустить этот шаг, если все и так ясно? Фрэнсис Джон Энскомб категорично мотает головой.
В 1973 году английский статистик опубликовал статью «Graphs in Statistical Analysis», в которой впервые описал квартет Энскомба. Ее эпиграф гласит: «Графики – необходимая составляющая качественного статистического анализа». В то время ученый работал в Йельском университете, где в течении шести лет возглавлял кафедру статистики. Энскомб был одним из первых, кто начал использовать компьютеры для статистического анализа данных.
Для эксперимента Энскомб придумал 4 набора данных, статистические характеристики которых – среднее значение, дисперсия, корреляция и уравнение линейной регрессии – равны между группами. Каждый датасет содержит 11 пар x и y. Если построить график для каждой группы, то мы увидим колоссальное различие между визуальными паттернами. На слайде я отразил графики, опубликованные ученым.
Такой набор данных называется квартетом Энскомба. Совпадение статистических значений в нем возможно по нескольким причинам. Во-первых, внутри каждой группы данных значения подобраны так, чтобы одни точки компенсировали значения других, сильно отклоняющихся от тренда. Во-вторых, значения x и y выбраны так, что средние и дисперсии остаются одинаковыми при разных графиках.
Квартет Энскомба иллюстрирует, что одни только статистические показатели не гарантируют правильную интерпретацию данных. Две выборки могут выглядеть совершенно по-разному на графиках, но иметь одинаковые статистические характеристики. Поэтому визуализация необходима для полного понимания данных и выявления возможных аномалий. Зачастую даже простой диаграммы рассеяния достаточно, чтобы заметить различия в группах.
#аномалии
Post #196
2.63K

- 🔥 26
- 👍 3
- 👾 2