Сколько стоят данные? Какова их общественная ценность? Какие инвестиции в данные оправданы? Какую ценность имеет каждое конкретное наблюдение для предиктивной способности алгоритмов? Какой должна быть справедливая компенсация владельцам данных?
Рынки данных зачастую отсутствуют, но рыночные механизмы не всегда будут позволять достигать общественно оптимального уровня производства и использования данных из-за того, что данные не являются традиционным частным благом.
Ценность данных зависит от того, на каком этапе создания общественной ценности находятся данные: “сырые” необработанные данные, предобработанные данные, интегрированные данные (связанные данные из нескольких источников), их анализ, получение инсайтов на основе данных и действия на основе полученных инсайтов (доказательная политика).
Ценность данных увеличивается на каждом таком этапе и находится в зависимости от ценности на самом последнем шаге (от ценности доказательного принятия решений). Например, ценность данных о получателях социальной помощи (сейчас хранятся в бумажном виде) зависит от того, какие действия могли бы стать возможными при использовании результатов анализа этих данных в машиночитаемом виде - например, от адаптивности и скорости разработки индивидуальных программ социальной адаптации для тех, кто в них нуждается, при использовании рекомендательных алгоритмов.
В последние два года научным сообществом опубликовано несколько десятков статей о различных подходах к оценке стоимости данных. Но консенсуса об измерении ценности данных пока нет.
Например, Диана Койл и Анабель Менли (Coyle, Manley, 2021) используют совместный анализ (conjoint analysis) для определения общественной ценности показателей World Development Indicators. Это опрос потенциальных потребителей относительно выбора между различными комбинациями цен и характеристик данных (временной разрез, пространственная гранулярность и иные атрибуты) и байесовское моделирование на основе его результатов.
Другая ветка анализа опирается на использование вектора Шепли. Оценка стоимости данных решается как проблема распределения ценности алгоритма между различными источниками данных. Это достаточно хорошо изученная экономистами проблема распределения прибыли, созданной коллективными усилиями, в теории кооперативных игр.
Подход помогает, например, определять значимые наблюдения с точки зрения точности обнаружения пневномнии: при обучении на данных низкого качества удаление обучающих данных с низкими значениями Шепли повышает точность модели.
https://telegra.ph/Ocenka-stoimosti-dannyh-skolko-stoyat-dannye-i-kakie-investicii-v-nih-opravdany-08-15
Post #27
666