"А чем вы вообще тогда занимаетесь?", — спросил меня один дата-аналитик с библейским именем. До этого я несколько минут в курилке пытался объяснить, что такое делают дата-журналисты и зачем. Последний вопрос был задан в ответ на признание, что ни регрессиями, ни t-тестами мы обычно не занимаемся. (Для справки: регрессия и t-тест — это способы анализа данных, основанные на математической статистике).
Я пытался что-то мямлить, мол, ну мы ищем какие-то тенденции столь явные, что даже t-тест (один из наиболее простых способов статистически обосновано сравнивать две группы) нам в сущности не нужен. На самом деле так себе объяснение... ничего удивительного, что дата-аналитик с библейским именем в итоге сказал: "да вы просто, получается, срываете низко висящие фрукты". Проще говоря, дата-журналисты в его представлении видят какие-то две циферки которые различаются слишком сильно, чтобы быть незаметными, и этому радуются. В общем... я был не на высоте в том разговоре...
Быть может, я чуть-чуть набил руку. Может быть, просто пример теперь есть более удачный. Во всяком случае, кажется, я лучше могу ответить на этот вопрос! Сейчас я пишу текст о том, как советские и российские спортсмены выступали на зимних олимпийских играх. В распоряжении у меня дата-сет (сиречь таблица с данными), который энтузиасты собрали много лет назад. И новый дата-сет (которым я обязан Елизавете Копыловой — спасибо ей большое), куда добавлены данные за 2018 и 2022 годы.
Поначалу все казалось довольно просто — вот есть информация по играм — бери, подбивай те самые пары цифр. Сколько было в сборной, как много медалей — красота. Но тут... возникла проблема... выяснилось, что данные о числе спортсменов в сборных СССР и России между дата-сетами не бились. Не совпадали они и с Википедией. К примеру... Вики и старый дата-сет говорили, что от Советского Союза в 1956 году на игры поехало 53 человека. новый датасет — 54. Что? Как? Почему? Ну, кажется, такая легкодоступная информация должна уж везде быть одинаковой.
И вот данные за каждую олимпиаду пришлось вручную проверять (хвала Силе есть DeepSeak), выискивая "лишних". А потом... пытаться понять, что это за лишние. К примеру, с 1956-м годом очень интересная история. Википедия, официальная история игр, старый дата-сет не считают участником игр советского прыгуна с трамплина Николая Каменского. Ищу, в чем же дело-то... Гуглю, и вот, наконец, нахожу его интервью в котором он рассказывает, что же случилось тогда на олимпиаде. Дело в том, что его сняли с соревнований после первой же попытки:
«Я хорошо помню этот прыжок [на играх 1956-го]. Он был идеальным. Все судьи уже выставили мне оценки — по 19 с половиной баллов, почти максимум. И в самом конце я упал… Как это произошло, я и сам не понял. Во время прыжка у меня порвалась молния на брюках, а запасных не оказалось, и главный тренер сборной не нашел ничего лучше, как снять меня с соревнований».
Рассказ настолько грустный, что я его, разумеется, вставил в текст. Но, собственно, к чему я это? Да все к тому же. Чем занимаются дата-журналисты, которые даже не делают t-тест и не строят регрессионные модели для анализа данных (хотя, спасибо за уточнение от Кати Горбуновой — иногда все же делают)? Тем же, что и обычные журналисты — рассказывают истории. Просто не через видео, фото или интервью, а через анализ информации, собранной в аккуратные (ах как бы хотелось бы....) по возможности аккуратные таблицы. Они пытаются увидеть историю за цифрами, которые слишком отличаются, чтобы быть незаметными... Найти порванные штаны и разрушенные надежды в разнице между цифрами 53 и 54...
Так что... эй! Дата-аналитики! Подходите, я могу ответить на ваши вопросы!
P.S. Конечно же, весь мир — Зимняя Олимпиада, а мы в ней Николай Каменский...