DuckDB ускорил чтение CSV из S3 почти в 20 раз
31 июля разработчики DuckDB представили асинхронное чтение Parquet и CSV, которое станет стандартным в DuckDB 2.0.
В тесте TPC-H запрос к CSV-файлу размером 80,9 ГБ в S3 ускорился с 878 до 45 секунд. Для Parquet время сократилось с 8,23 до 2,84 секунды.
Отдельный пул I/O-потоков и управляемый памятью read-ahead позволяют не блокировать вычислительные потоки на сетевых запросах. Для инженеров это означает заметно более эффективные запросы к удалённым озёрам данных без предварительной загрузки файлов.
Источник: DuckDB — Asynchronous I/O
#duckdb #dataengineering #asynchronousio #s3 #parquet #datalake
@data_engi
Post #1175
196