Arrow научился сжимать Bloom-фильтры уже после записи данных
В Apache Arrow 25.0.0 изменили создание Bloom-фильтров для Parquet. Сначала фильтр выделяется под предполагаемое число уникальных значений, а после записи автоматически уменьшается под фактическую кардинальность.
Раньше консервативная оценка могла оставлять в каждом файле неоправданно большой фильтр. Теперь Parquet экономит место, сохраняя заданную вероятность ложного срабатывания и возможность быстро отбрасывать ненужные данные.
Для инженеров это означает меньшие файлы и меньше лишнего ввода-вывода без необходимости точно предсказывать кардинальность столбца заранее.
#apachearrow #parquet #bloomfilter #dataengineering #queryoptimization #datastorage
@data_engi
Post #1189
201