😍 Iceberg-каталог теперь сам решает, какие файлы читать
Раньше каждый клиент Iceberg загружал списки манифестов и сами манифесты, а затем локально вычислял набор файлов для запроса. На больших таблицах это нагружало сеть и память драйвера Spark.
В Iceberg 1.11 REST-каталог может выполнить планирование на сервере и потоково вернуть только готовые задачи чтения. Механизм также охватывает инкрементальные запросы Structured Streaming и служебные таблицы history и snapshots.
Для инженеров это меньше метаданных на клиентах и возможность централизованно улучшать планирование без изменений в движках. Но REST-каталог и клиент должны поддерживать новый протокол.
#apacheiceberg #lakehouse #restcatalog #apachespark #structuredstreaming #dataengineering
@data_engi
Post #1233
182
- ❤🔥 4