⭐️ В Spark меньше executors иногда означает быстрее и дешевле
AWS сравнила два кластера EMR Serverless с одинаковыми 192 vCPU: 6 крупных executors по 32 vCPU против 48 небольших по 4 vCPU.
На 126 запросах TPC-DS и TPC-H крупные workers с оптимизированными под shuffle дисками оказались в среднем на 29% быстрее и дешевле. Один executor получал данные только от 5 удалённых источников вместо 47 — меньше сетевой координации, удалённых чтений и spill на диск.
Для инженеров вывод неочевидный: при тяжёлых join, groupBy и repartition увеличение числа executors может мешать. Но для обычного I/O без большого shuffle множество небольших workers всё ещё способно дать больше параллелизма.
Источник: AWS Big Data Blog — 29 июля 2026 года
#apachespark #amazonemr #shuffle #dataengineering #distributedcomputing #performance
@data_engi
Post #1234
196