【岗位职责】
1、负责设计、开发和维护高性能、高可和的实时和离线数据管道,处理日均千万级的数据;
2、负责从多种数据源(如电商数据、IOT设备数据、社交媒体、第三方数据API等)进行数据采集、清洗和集成;
3、参与设计和构建数据仓库/数据湖,负责数据分层(ODS、DWD、DWS、ADS)和主题域划分;
4、深入理解家电业务,设计合理的数据模型,以支持灵活、高效的市场分析、用户画像和OLAD查询;
5、使用 Spark, Flink, Hive 等大数据技术,编写高效的数据处理作业,完成复杂的ETL/ELT任务;
6、持续监控数据任务的性能和健康状况,定位并解决数据延迟、数据倾斜、计算资源瓶颈等问题;
7、保障数据质量,建立和完善数据稽核、监控和报警体系,确保数据的准确性和一致性;
8、负责大数据集群(如 Hadoop, Spark, Flink 集群)的运维、调优和成本控制。
【岗位要求】
1、计算机科学、软件工程、数学或相关专业本科及以上学历,5年以上大数据开发经验;
2、精通 Java/Scala/Python 中至少一门编程语言。具有扎实的 SQL 能力,熟悉性能调优,有Hive, Spark SQL, Presto 等使用经验;
3、深入理解 Hadoop 生态系统(HDFS, YARN, Hive)及 Spark 的核心原理,有实时数据处理经验,熟悉Flink、Kafka等流处理技术更佳;
4、熟悉OLAD引擎(如clickhouse、doris),并有相关优化经验;
5、了解机器学习平台或数据科学的协作流程,有相关经验者更佳;
6、熟悉至少一种主流调度系统(如DolphinScheduler、Airflow);
7、拥有从0-1构建或深度参与大型数据仓库/数据平台建设的经验,熟悉数据仓库建模理论。