Datafold провели исследование о состоянии качества данных
Больше 80% респондентов отметили, что регулярно сталкиваются с проблемами с качеством данных.
Большинство ошибок, по их словам, происходят по вине других команд или третьих лиц (75%) 🙂.
Только 41% команд используют методы и инструменты проверки данных: автоматизированные тесты или каталоги данных.
Низкая продуктивность data-команд вызвана большим количеством ручной работы, неэффективной организацией и плохим качеством данных
SQL по прежнему остаётся главным рабочим языком, за ним идут Python, R и Scala.
Среди BI-инструментов, на первом по месте остаётся Tableau, а за ним - как ни странно, Google Таблицы 😱
Для ETL чаще всего используют собственные инструменты (28%), Apache Airflow (24%), AWS Glue (14%).
И хотя средний уровень удовлетворенности стеком данных составляет всего 3.3/5, компании не спешат ничего менять: изменения слишком дорогие (32%) или же есть организационные проблемы (30%)
via @internetanalytics
Post #3690
8.67K
