Дифференциальная приватность и TopDown алгоритм Бюро переписи населения США
При публикации больших объемов данных стат. ведомствам и коммерческим компаниям неизбежно приходится искать компромисс между детализацией и конфиденциальностью данных. С одной стороны, пользователи данных стремятся получить доступ к более гранулярным данным. С другой стороны, оператор, раскрывающий данные, ограничен требованиями законодательства о защите персональных данных и этическими соображениями. Традиционно используются методы снижения детализации и зашумления, чтобы исключить возможность идентификации реальных людей в опубликованной информации.
💡В этот вторник Бюро переписей населения США выложило программную статью про механизм обеспечения конфиденциальности данных при публикации результатов переписи 2020 года — TopDown алгоритме с дифференциальной приватностью.
🤔 В чем идея дифференциальной приватности? Она заключается в том, что внешний пользователь не имеет доступа к микроданным, но может строить различные запросы агрегированной статистики к ним. К примеру, запрашивает информацию о количестве наблюдений, обладающих определенными характеристиками. Так работал конструктор на данных переписей 2002 и 2010 годов Росстата (к сожалению, безвременно от нас ушедший). Но если запросы детальные, то выполнив их достаточно много и в большем числе разрезов, можно будет восстановить исходные микроданные. Дифференциальная приватность предполагает, что в ситуации, когда внешний пользователь имеет доступ к двум версиям набора данных, которые различаются всего на одно наблюдение, один и тот же запрос агрегированной статистики по любому атрибуту (например, подсчет количества записей с определенными характеристиками) с высокой вероятностью должен вернуть одинаковый результат.
Тогда значения атрибутов для этого наблюдения хорошо защищены — даже выполнив много запросов, восстановить исходные микроданные не получится. Если такой принцип выполняется для каждого наблюдения в наборе данных, то он соответствует принципу дифференциальной приватности. Реализовать механизм дифференциальной приватности можно использую различные алгоритмы, которые к результату запроса добавляют случайный шум. А уровень шума выбирается как раз такой, чтобы удаление или добавление одного наблюдения, почти не меняло доступный пользователю результат.
Простая идея на практике сталкивается с большим числом вызовов, о которых в статье тоже идет речь. Например, нужно, чтобы при последовательной агрегации зашумленных данных от переписных блоков к штатам все суммы в дифференциально приватных данных сходились. Или, чтобы при подсчете числа наблюдений алгоритм в результате зашумления не выдавал отрицательные числа.
Что еще посмотреть:
· Github-репозиторий Census Bureau c исходным кодом TopDown алгоритма
· 12-минутный популярный ролик про дифференциальную приватность
· Подробное руководство по дифференциальной приватности есть в книге Differential Privacy and Applications
Иллюстрация к посту: https://habr.com/ru/company/domclick/blog/526724/
Post #82
491