📝Валидация датафреймов с Python-библиотекой Pandera
В крупных DS-проектах для валидации датасета и проверки качества данных можно использоваться фреймворк Great Expectations. Однако, для более мелких задач нужны более простые инструменты. Например, легковесная Python-библиотека Pandera, которая явно проверяет информацию в датафреймах во время выполнения. Pandera позволяет определить схему данных один раз с помощью API на основе классов с pydantic-синтаксисом и использовать ее для проверки различных типов датафреймов, включая pandas, dask, modin и pyspark.pandas. Можно проверять типы и свойства столбцов в pd.DataFrame или значения в pd.Series, выполняйте более сложную статистическую проверку, например проверку гипотез. Из объектов схемы можно синтезировать данные для тестирования на основе свойств с помощью структур данных pandas.
Декораторы функций позволяют интегрироваться с существующими конвейерами анализа/обработки данных с помощью декораторов функций. Благодаря отложенной проверке, можно валидировать датафреймы до возникновения ошибок. Наконец, совместимость с другими Python-инструментами, таких как pydantic, fastapi и mypy, делают Pandera полезным средством для ML-разработчика и аналитика данных.
Документация: https://pandera.readthedocs.io/en/stable/
Практический пример: https://towardsdatascience.com/validate-your-pandas-dataframe-with-pandera-2995910e564
Post #236
811