Кто работает с микроданными обследований населения, которые проводит Росстат, в курсе, что с их публичной организацией не всё одинаково. Например, если сравнивать анкеты и содержание открытых файлов микроданных, некоторые обследования практически полностью представлены на сайте, а для некоторых в открытых микроданных отсутствует часть переменных; не все обследования хранятся в одном месте «Федеральные статистические наблюдения по социально-демографическим проблемам», а распределены по тематическим разделам. К примеру, микроданные обследования рабочей силы, если не пользоваться закладками, могу найти только по записанному пути, так как спрятаны они в лабиринтах раздела «Рынок труда, занятость и заработная плата». Распаковка большинства массивов микроданных требует Nesstar Explorer, но есть исключения. И микроданные каких-то обследований до последнего времени не публиковались в принципе, как было с Выборочным наблюдением состояния здоровья населения (ВНСЗН). А в 2023 микроданные этого обследования неожиданно появились на сайте, сразу .sav-файлом, но без переменной весовых коэффициентов (что несколько обессмысливает данные). Причем появились оперативно, через месяца три после проведения обследования, при том, что другие открывают через год. Кстати, за 2024 ВНСЗН уже тоже доступно. И тоже без весовых коэффициентов.
Публикация микроданных ВНСЗН не только названные шаблоны / ожидания нарушило. Как бы ни публиковались микроданные других обследований, в открытых файлах никогда не было переменной, по которой можно было идентифицировать населённые пункты. Конечно, по региону, численности населения в населённом пункте, другим переменным можно было определить респондентов из конкретных крупных городов, но ВНСЗН – единственное известное мне обследование, в открытых данных которого есть переменная ОКАТО с 11-значными кодами. Вот, к примеру, якутское село с населением чуть больше 2 тыс. человек, в котором опросили членов 27 домохозяйств. И указан состав этих семей, возраст, пол, вес, рост всех членов. А также множество ответов об их здоровье и вокруг него.
Что-то мне подсказывает, что анонимность и конфиденциальность в открытых данных обследований населения обеспечивается иначе. Можно успокаивать, что никому в голову не придет кого-то вычислять по этим данным, что SPSS есть не у каждого, чтобы данные прочитать (хотя одна платформа с открытыми данными конвертировала ВНСЗН в экселевские файлы вместе с ОКАТО). Но всё же: стоит ли создавать такой риск? Как оценивать такую ситуацию с точки зрения этики данных? И что насчёт единой политики данных в одной организации?
Post #358
460
- 🤔 8
- 😢 2
- 🤨 1