Библиотека Polars продолжает сокращать разрыв между локальной обработкой данных и полноценными хранилищами данных (Data Lakehouses).
Версия 1.39 принесла три ключевых фичи, которые сильно упростят жизнь дата-инженерам.
📈 1. Streaming AsOf Join
Функция
join_asof() теперь поддерживается стриминговым движком.Теперь можно объединять огромные временные ряды (time-series), которые не помещаются в оперативную память.
Идеально для финансового анализа и данных с датчиков (IoT), где нужно сопоставить события по ближайшей метке времени.
🧊 2. Полноценный цикл с Apache Iceberg
В дополнение к чтению (`scan_iceberg`), появился
sink_iceberg() для записи данных из LazyFrame.Polars теперь поддерживает полный цикл чтения/записи для архитектур Data Lakehouse на базе Iceberg.
Можно обрабатывать данные и сохранять их напрямую в аналитические таблицы без промежуточных CSV/Parquet файлов.
☁️ 3. Стриминг прямо из облака
Функции
scan_csv(), scan_ndjson() и scan_lines() теперь умеют скачивать данные потоково.Polars больше не нужно скачивать файл целиком из S3 или Azure Blob перед началом обработки.
Значительная экономия места на диске и ускорение «холодного» старта ваших скриптов.
🔗 Ссылка на релиз
📍 Навигация: Вакансии • Задачи • Собесы
🐸 Библиотека питониста
#буст
