DataFusion перестал читать терабайты ненужных полей из Parquet 😁
В Apache DataFusion 55 исправили чтение вложенных колонок. Раньше движок мог декодировать все поля структуры, даже если запросу требовалась лишь их часть, а затем выбрасывать лишние данные.
В реальном запросе DataFusion Comet это привело к чтению 1,35 ТБ вместо 30,9 ГБ у Spark. Теперь необъявленные вложенные поля Parquet вообще не загружаются.
Для пользователей Comet, delta-rs и Iceberg-интеграций это означает меньше трафика из объектного хранилища, нагрузки на CPU и расходов — без изменения файлов или SQL. Эффект относится именно к Parquet с неиспользуемыми вложенными полями.
#apachedatafusion #parquet #apachearrow #queryengine #performance #dataengineering
@data_engi
Post #1330
163