职位描述
数仓开发数据建模数据治理Hive sqlSpark sqlJavaHadoopHiveSpark实时数仓建设数据任务性能调优
工作职责
1. 主导企业级数据仓库的分层架构设计与核心模型开发,严格遵循Kimball维度建模方法论完成ODS/DWD/DWS/ADS各层模型落地,保障全链路数据的一致性、易用性与可扩展性。
2. 负责大数据计算任务的性能优化与数据治理专项,针对性解决Hive/Spark SQL运行中的数据倾斜、小文件堆积、任务长尾等生产问题,搭建数据质量监控、元数据管理体系,持续推进计算与存储成本优化。
3. 统筹离线与实时数据链路的迭代建设,保障离线数仓T+1任务的产出时效与SLA达标率,参与基于Flink的实时数仓搭建,支撑核心业务指标的分钟级/秒级产出需求。
4. 牵头制定并落地数据开发全流程规范,覆盖模型命名、分层设计、权限管控、表生命周期管理等全环节,参与团队代码评审,整体提升数据研发的工程质量与交付效率。
5. 深度对接数据分析师、产品经理等业务侧角色,将业务需求转化为可落地的数据模型方案,统一核心指标的统计口径,为业务决策、数据分析场景提供稳定高效的数据支撑。
任职要求
1. 本科及以上学历,计算机、数学、统计学等相关专业。
2. 拥有5年以上数据仓库/大数据开发经验,其中至少3年专职负责数仓模型设计工作,熟悉数据仓库ODS-DWD-DWS-ADS分层架构,熟练掌握星型/雪花模型、缓慢变化维、拉链表等维度建模核心方法。
3. 精通Hive SQL与Spark SQL,具备丰富的生产环境性能调优经验,能够独立处理数据倾斜、MapJoin优化、小文件合并等常见问题;熟练掌握Hadoop/Hive/Spark大数据生态,具备日增量TB级以上海量数据的处理实战经验。
4. 熟练使用至少一种主流调度工具(Airflow/DolphinScheduler/DataWorks等),具备完整的ETL任务调度依赖配置与生产运维经验;理解数据治理核心逻辑,有实际的数据质量校验、元数据管理或数据血缘梳理落地经验。
5. 具备扎实的编程能力,能够熟练使用Python或Java开发数据处理脚本,满足定制化数据加工需求。
6. 具备实时数仓(Flink/Kafka/CDC/流批一体)、数据湖(Iceberg/Hudi/Delta Lake)、云原生数仓(MaxCompute/EMR/Snowflake/Databricks)或数据治理工具(Atlas/DataHub/dbt)实施经验者优先;有互联网、电商、金融或大型SaaS行业数仓建设经验者优先。
1. 主导企业级数据仓库的分层架构设计与核心模型开发,严格遵循Kimball维度建模方法论完成ODS/DWD/DWS/ADS各层模型落地,保障全链路数据的一致性、易用性与可扩展性。
2. 负责大数据计算任务的性能优化与数据治理专项,针对性解决Hive/Spark SQL运行中的数据倾斜、小文件堆积、任务长尾等生产问题,搭建数据质量监控、元数据管理体系,持续推进计算与存储成本优化。
3. 统筹离线与实时数据链路的迭代建设,保障离线数仓T+1任务的产出时效与SLA达标率,参与基于Flink的实时数仓搭建,支撑核心业务指标的分钟级/秒级产出需求。
4. 牵头制定并落地数据开发全流程规范,覆盖模型命名、分层设计、权限管控、表生命周期管理等全环节,参与团队代码评审,整体提升数据研发的工程质量与交付效率。
5. 深度对接数据分析师、产品经理等业务侧角色,将业务需求转化为可落地的数据模型方案,统一核心指标的统计口径,为业务决策、数据分析场景提供稳定高效的数据支撑。
任职要求
1. 本科及以上学历,计算机、数学、统计学等相关专业。
2. 拥有5年以上数据仓库/大数据开发经验,其中至少3年专职负责数仓模型设计工作,熟悉数据仓库ODS-DWD-DWS-ADS分层架构,熟练掌握星型/雪花模型、缓慢变化维、拉链表等维度建模核心方法。
3. 精通Hive SQL与Spark SQL,具备丰富的生产环境性能调优经验,能够独立处理数据倾斜、MapJoin优化、小文件合并等常见问题;熟练掌握Hadoop/Hive/Spark大数据生态,具备日增量TB级以上海量数据的处理实战经验。
4. 熟练使用至少一种主流调度工具(Airflow/DolphinScheduler/DataWorks等),具备完整的ETL任务调度依赖配置与生产运维经验;理解数据治理核心逻辑,有实际的数据质量校验、元数据管理或数据血缘梳理落地经验。
5. 具备扎实的编程能力,能够熟练使用Python或Java开发数据处理脚本,满足定制化数据加工需求。
6. 具备实时数仓(Flink/Kafka/CDC/流批一体)、数据湖(Iceberg/Hudi/Delta Lake)、云原生数仓(MaxCompute/EMR/Snowflake/Databricks)或数据治理工具(Atlas/DataHub/dbt)实施经验者优先;有互联网、电商、金融或大型SaaS行业数仓建设经验者优先。
登录查看完整内容
工作地点
杭州*********

公司信息
公司介绍
科珠(广州)科技有限公司成立于2024年5月,位于广州市天河区,专注信息技术领域的软件研发与数据服务。公司主营业务涵盖人工智能基础软件开发、互联网数据服务、BI解决方案及信息技术咨询,同时提供软件销售与网络技术支持,聚焦为企业客户解决数据处理、智能算法应用等数字化需求。基于对AI图像识别、算法优化及数据可视化的技术布局,公司通过定制化软件服务助力客户提升运营效率。目前团队聚焦人工智能基础层技术的产品化落地,依托软件开发与售前技术支持能力,为各行业客户提供从需求分析到系统部署的全流程服务支持,逐步构建覆盖AI与数据领域的服务体系。
工商信息
企业名称 科珠(广州)科技有限公司
企业类型 有限责任公司(自然人投资或控股)
法人代表 陈宏敏
经营状态 在营(开业)
成立时间 2024-05-29
注册资本 10万元
认证资质
营业执照信息




