Flink выкинул Hadoop из пути к S3
В Apache Flink 2.3 появился flink-s3-fs-native — новый файловый плагин для S3, написанный специально для Flink и не зависящий от Hadoop.
В тестах среднее время создания чекпоинта сократилось с 90,1 до 48,8 секунды, а на небольших состояниях ускорение доходило до 4,5 раза. Заодно проект перешёл с устаревшего AWS SDK v1 на v2 и уменьшил дерево зависимостей.
Для потоковых систем это означает более быстрое восстановление после сбоев, меньше данных для повторной обработки и более короткие задержки при exactly-once записи. Пока плагин экспериментальный и подключается вручную.
#apacheflink #dataengineering #streamprocessing #s3 #checkpoints #reliability #infrastructure
@data_engi
Post #1171
173