В PyIceberg 0.12 появился
incremental_append_scan(). Он читает только строки, добавленные между двумя снимками Iceberg, а идентификатор снимка можно использовать как курсор следующего запуска.Для инженеров это основа лёгких инкрементальных загрузок на Python: небольшую порцию новых данных можно обработать через Arrow или Polars, не перечитывая таблицу целиком и не поднимая Spark.
Важный нюанс: это не полноценный журнал изменений. Операции удаления, перезаписи и замены файлов игнорируются, поэтому механизм рассчитан прежде всего на append-only конвейеры. Результаты компактации повторно не учитываются.
Пруфы:
🔘релиз PyIceberg 0.12.0 от 1 сентября 2026 года
🔘реализация и описание API
#pyiceberg #apacheiceberg #incrementalprocessing #python #datalake #dataengineering
@data_engi