大数据开发工程师|Flink 实时计算 / Doris / 数据平台方向
━━━━━━━━━━━━━━
工作模式:可远程
候选人要求:国籍不限|台籍优先
薪资范围:以沟通为准
职位亮点
1. 深度参与公司大数据平台建设,覆盖实时计算、离线处理、数据同步、数据清洗及数据加工等完整链路。
2. 以 Apache Flink / Flink SQL 为核心,负责实时数据任务开发及高并发数据处理。
3. 深度参与 Apache Doris 数据模型、表结构、查询性能及集群稳定性优化。
4. 技术栈覆盖 Kafka、Hadoop、Hive、Spark、ClickHouse、StarRocks、Hudi、Iceberg 等主流大数据生态。
岗位职责
1. 负责公司大数据平台相关需求的开发与维护,包括实时数据处理、离线数据处理、数据同步、数据清洗及数据加工等工作。
2. 基于 Flink / Flink SQL 开发实时数据任务,根据业务需求完成数据采集、转换、聚合、关联及实时指标计算。
3. 参与 Flink 集群及实时任务的日常维护,包括任务发布、监控、异常排查、性能优化、Checkpoint / Savepoint 管理及资源使用分析。
4. 负责 Doris 相关数据模型设计、表结构设计、数据导入及查询开发,并参与 Doris 集群日常维护、性能分析与问题排查。
5. 参与 Kafka、RocketMQ 等消息中间件的数据链路建设,处理实时数据消费、数据积压、延迟及异常数据等问题。
6. 参与大数据平台数据链路的建设与优化,包括数据接入、数据同步、实时计算、数据存储及数据查询等环节。
7. 根据业务需求编写 SQL、Flink SQL 及相关数据处理程序,为业务报表、数据分析及实时数据服务提供支持。
8. 负责线上大数据任务运行监控与故障处理,对任务失败、数据延迟、数据异常及资源不足等问题进行定位和解决。
9. 参与大数据平台性能及稳定性优化,包括任务资源配置、SQL 优化、数据倾斜、数据热点、查询性能及存储优化。
10. 参与其他大数据组件或平台的使用与维护,包括 Kafka、Hadoop、Hive、Spark、Flink、Doris、ClickHouse、StarRocks、Hudi、Iceberg、Airflow、DolphinScheduler 等。
11. 配合业务及研发团队完成数据问题排查、历史数据重算、数据修复及临时数据需求。
任职要求
1. 计算机、软件工程或相关专业,具备 2 年以上大数据开发相关经验。
2. 熟练掌握 SQL,具备良好的数据处理和数据分析能力,能够独立完成复杂 SQL 开发及性能优化。
3. 熟悉 Apache Flink,并具备 Flink SQL 实际项目经验。
4. 了解 Flink 基本运行原理,包括 JobManager / TaskManager、Checkpoint / Savepoint、Watermark、State、Window、Exactly Once,以及任务并行度与资源配置。
5. 具备一定的 Flink 任务运维及故障排查能力,能够处理任务失败、Checkpoint 异常、Backpressure、数据积压、数据倾斜及资源不足等常见问题。
6. 熟悉 Apache Doris,并具备实际项目使用经验。
7. 熟悉 Doris 数据模型、表结构设计、分区与分桶、数据导入、SQL 查询、性能优化及集群基本架构。
8. 熟悉 Kafka 等消息中间件,理解 Topic、Partition、Consumer Group、Offset 等基本机制,并能够排查消息积压及消费异常。
9. 熟悉 Linux 环境,能够使用常用 Linux 命令进行日志分析、服务检查及问题排查。
10. 对大数据平台整体架构有一定理解,熟悉「数据采集 → 消息队列 → 实时计算 → 数据存储 → 数据服务」的完整数据链路。
11. 具备较强的问题定位能力和责任心,能够独立分析并处理线上数据任务及大数据平台相关问题。
加分项
1. 有较大规模 Flink 实时计算平台实际开发或运维经验者优先。
2. 有 Doris 集群部署、扩容、升级、性能调优或线上故障处理经验者优先。
3. 熟悉 ClickHouse、StarRocks、Hive、Spark、Hudi、Iceberg 等一种或多种大数据技术者优先。
4. 熟悉 DolphinScheduler、Airflow 等任务调度平台者优先。
5. 有实时数仓、数据仓库或数据中台建设经验者优先。
6. 有 Kubernetes 环境下 Flink 或其他大数据组件部署、运维经验者优先。
7. 有高并发、大数据量及实时数据处理相关项目经验者优先。
我们期待这样的你
你需要具备扎实的大数据开发能力,不仅能够完成 Flink SQL、实时任务及数据链路开发,也能够处理线上任务故障、数据积压、性能瓶颈及集群稳定性问题。
如果你熟悉 Flink、Doris、Kafka 等大数据核心技术,并有实时数仓、数据平台或大规模数据处理经验,欢迎推荐或自荐。
━━━━━━━━━━━━━━
Post #347
579
- ❤ 2