Spark может пережить смерть executor без пересчёта shuffle
Обычно shuffle-данные лежат на локальных дисках executor-узлов. Если Spot-инстанс исчезает, Spark теряет эти блоки и вынужден заново выполнять предыдущие стадии.
Apache Celeborn выносит shuffle в отдельный общий кластер. Executors отправляют туда блоки заранее, поэтому вычислительные узлы можно свободно перезапускать и масштабировать, а при включённой репликации потеря узла не уничтожает промежуточные данные.
Для тяжёлых Spark-задач это позволяет шире использовать дешёвые Spot-инстансы и не держать простаивающие узлы только ради сохранения shuffle. Цена — отдельный stateful-сервис, которому нужны репликация, мониторинг и защита данных.
#apachespark #apacheceleborn #shuffle #dataengineering #distributedcomputing #infrastructure @data_engi
Post #1198
175