⭐️Spark научился загружать терабайты в Postgres в обход основного узла
8 октября Databricks раскрыла архитектуру массовой загрузки в Lakebase Postgres. Вместо отправки каждой строки через COPY исполнители Spark параллельно создают настоящие страницы Postgres, проверяют их контрольные суммы и записывают прямо в распределённое хранилище.
Основной узел получает только описание готовых файлов, фиксирует его компактной записью WAL и атомарно подключает таблицу. Поэтому загрузка почти не отнимает CPU, память и дисковый ввод-вывод у рабочих OLTP-запросов.
Во внутреннем тесте 1 ТБ загрузили менее чем за пять минут — ускорение достигло 147 раз. Но пока показатель относится к созданию страниц таблицы: параллельную сборку индексов Databricks ещё дорабатывает.
Пруф: Databricks — 8 октября 2026 года
#databricks #postgresql #apachespark #ltap #bulkloading #database #dataengineering
@data_engi
Post #1406
111