В пятницу выступал на форуме «Цифровые решения». Была прекрасная сессия про качество данных.
Любимая мной тема, которая в принципе хорошо описывается фразой «Garbage in - Garbage out». Был удивлен тем фактом, что некоторую часть дискуссии мы потратили на то, что бы убедиться, что все согласны с тем, что исправления надо вносить на источнике, а не на целевой системе. Кажется довольно очевидным фактом.
В целом, я пришел с таким набором тезисов в голове:
1. Качество данных это про инструменты или про процессы?
Это в первую очередь про процессы, которые поддерживаются инструментами.
• Процессы определяют что, кто, когда и как делает для обеспечения качества. Без четких процессов (сбор, валидация, стандартизация, обновление, мониторинг) даже самый дорогой инструмент превратится в "пылесборник".
• Инструменты — это как мы эффективно и масштабируемо выполняем эти процессы. Они автоматизируют проверки, выявляют аномалии, визуализируют метрики.
Вывод: Качество данных — это в 80% управленческая и организационная задача (процессы, люди, ответственность) и на 20% — технологическая.
2. Каковы ключевые «болевые точки» в процессах сбора и обработки данных, влияющих на качество?
1 "Мусор на входе — мусор на выходе": Данные вводятся без немедленной проверки на корректность.
2 Ручной ввод и человеческий фактор: Опечатки, нестандартные форматы .
3 Разрозненность и изолированность систем ("силосы данных»). Нет "единой версии правды".
4 Отсутствие единых стандартов и справочников.
5 Несвоевременное обновление.
6 Слабая координация между источниками.
3. Как измерять качество данных?
Качество данных измеряется через набор метрик:
• Полнота: Какой процент обязательных полей заполнен?
• Точность / Достоверность: Насколько данные соответствуют реальности? (Проверяется через перекрестные проверки с доверенными источниками).
• Непротиворечивость: Не противоречат ли данные внутри системы и между системами?
• Своевременность (актуальность): Насколько данные обновлены по отношению к реальному миру?
• Уникальность: Нет ли дублирующихся записей об одном и том же объекте?
• Валидность: Соответствуют ли данные заданному формату, типу и диапазону значений? (Например, email должен содержать "@").
И все возможные комбинации их.
4. С какими основными типами ошибок вы сталкиваетесь чаще всего и к каким последствиям это приводит?
1 Дубликаты записей
2 Ошибки ручного ввода: Опечатки
3 Неактуальные данные - Решения принимаются на основе устаревшей информации
4 Нарушение референциальной целостности: Запись ссылается на несуществующий объект.
5. Можно ли автоматически выявлять и исправлять аномалии и ошибки в данных, не создавая новых рисков?
Да, но с оговорками.
◦ Выявлять — можно и нужно автоматизировать на 90%. Правила, статистические методы и ML-модели отлично справляются с этим.
◦ Исправлять — здесь нужна осторожность.
Стратегии:
a Автоматическое исправление по четким правилам.
b Пометить на проверку ответственному - Для сложных случаев или потенциальных дубликатов система не принимает решение сама, а создает заявку для проверки человеком.
c Заблокировать запись и запросить источник: Система не пропускает некорректные данные и требует перепроверки на точке ввода.
◦ Главный риск автоматического исправления — ложное срабатывание и "исправление" правильных данных на неправильные. Поэтому полная автоматизация исправления применяется только для самых простых и безошибочных сценариев.
Post #167
775

- 🔥 7
- 👍 2