Spark продолжает развиваться: из распределённого вычислительного движка он превращается в платформу, которая изначально понимает современные задачи обработки данных и AI.
Вот четыре нововведения, которые особенно выделяются.
Нативные геопространственные типы
В Spark появились встроенные типы данных GEOMETRY и GEOGRAPHY для работы с геоданными и пространственной информацией.
Теперь геопространственные данные стали частью основной системы типов Spark и соответствуют отраслевым стандартам. Это делает пространственную аналитику в Spark SQL гораздо более естественной.
Стандартизированный CDC API
Одно из самых интересных нововведений. Spark получил единый API CHANGES для работы с изменениями на уровне строк через коннекторы Data Source V2.
Сейчас каждый табличный формат (Apache Iceberg, Hudi, Delta) предоставляет доступ к изменениям по-своему.
Перенос семантики CDC непосредственно в Spark — важный шаг к созданию переносимых инкрементальных пайплайнов независимо от формата таблиц.
Python UDF на Apache Arrow включены по умолчанию
Теперь Spark по умолчанию использует Apache Arrow для выполнения Python UDF и связанных операций PySpark.
Это уменьшает накладные расходы на сериализацию между JVM и Python, ускоряет обмен колонночными данными и должно дать заметный прирост производительности существующим PySpark-приложениям без каких-либо изменений в коде.
NEAREST BY JOIN
В Spark появился новый SQL-оператор для выполнения top-K similarity join (соединения по ближайшему сходству).
Вместо сложных запросов с
CROSS JOIN и оконными функциями теперь можно выразить поиск ближайших соседей как обычную операцию JOIN.Это открывает новые возможности для задач семантического поиска, рекомендательных систем, RAG и других AI-сценариев.
@tldr_data
