Как читать Parquet-файлы с pandas
Колоночный формат Apache Parquet широко распространен в области Big Data благодаря хранению данных по столбцам и эффективному сжатию. Он позволяет быстро считать нужные данные из конкретного столбца вместо чтения полной строки, что экономит время. Однако, не каждая прикладная система умеет читать бинарные Parquet-файлы. Часто приходится преобразовывать Parquet-файлы в формат CSV или TXT, прежде чем открыть их, например, в MS Excel или Power BI, которые часто используются в работе DS-специалиста. В этом случае поможет Python-библиотека pandas со встроенной функцией считывания данных read_parquet() из Parquet-файла в датафрейм. Затем датафрейм можно сохранить в CSV-файле с помощью метода to_csv() и открывать его практически в любом офисном редакторе таблиц.
https://medium.com/@i.m.mak/workaround-for-reading-parquet-files-in-power-bi-e2d060abcb80
Post #165
396