Одним из препятствий на пути использования исследователями данных (помимо их отсутствия кончено) является наличие в данных персональной информации. Последние 15 лет на решение задачи нахождения баланса между максимальной гранулярностью данных и их конфиденциальностью направлены методы дифференциальной приватности (differential privacy).
Подробно о сути методов мы уже писали здесь, разбирая пример зашумления данных Бюро переписи населения США (пост для погружения в тему). Дифференциальная приватность - это компромисс и возможность для исследователей получить доступ к необходимым данным, поэтому чаще всего развитием методов differential privacy занимаются сами исследователи.
Мы искренне считаем, что развитие подходов к обеспечению открытого доступа к данным при сохранении их конфиденциальности позволит повысить ценность накопленных данных как в государственном, так и в частном секторе, используя их для принятия решений и исследований.
Именно поэтому продолжаем серию постов, и сегодня хотим опубликовать референсы на новый учебник Джо Нира (Университет Вермонта) и Чике Абуа: Programming Differential Privacy. Очень кропотливая и детальная работа: на примерах разбираются простые (удаление и зашумление) и более сложные (классификаторы машинного обучения) методы деидентификации данных. Эти материалы могут быть полезны сотрудникам статистических служб, ведомств, перед которыми стоят задачи по повышению открытости данных, а также для исследователей и научных сотрудников, которые часто становятся катализаторами инициатив предоставления данных в открытый доступ для научных сообществ. Если вам тема дифференциальной приватности интересна так же, как и нам, то рекомендуем посетить персональные сайты Джо Нира и Чике Абуа, где вы найдете дополнительный более основательный материал и практикумы по обеспечению конфиденциальности данных. Приятного чтения 📕. Ваш @evidencespace
Post #270
731

- 🔥 6
- 👍 2