182****4532niu****@***.com北京32男中高级ETL开发工程师在职北京25k-35k 
•主导校级大学生创新训练项目,基于开源组件搭建数据采集与清洗流水线,处理超百万行日志数据,获得优秀项目表彰。
•作为ACM校队成员,多次参加省赛及亚洲区域赛,通过算法设计与优化大幅提升大数据量下的查询效率,积累了扎实的性能调优经验。
•参与公司数据中台的ETL链路搭建,基于电商业务设计数据抽取策略,通过增量同步与分区技术将每日处理时间缩短40%。
•与运营及产品团队深度协作,梳理用户行为与交易数据口径,开发多维度的数据清洗与聚合逻辑,支撑实时看板与精准营销。
•构建ETL任务监控与告警机制,针对数据延迟或脏数据自动触发恢复流程,确保下游数据的完整性达到99.9%。
阿里巴巴(中国)有限公司 - 数据技术与产品部人工智能
2021.01-2023.06
•主导公司大数据平台ETL架构向云原生方向演进,采用Kubernetes与弹性计算资源,使任务调度成本下降约25%。
•带领5人小组完成集团级数据湖迁移项目,涉及数十TB业务数据,通过分批次校验与自动化比对保障迁移零丢失。
•编写《ETL开发规范与优化手册》,主持季度技术分享,推动团队在SQL性能调优与代码可维护性上的整体提升。
•该项目致力于将订单、库存、会员等多个遗留系统数据汇聚至统一数仓,支撑精细化运营分析。
•我主导ETL架构设计,选用DataX进行多源异构数据同步,并自研CDC组件实现秒级增量捕获。
•针对复杂的促销分摊、退款冲正等业务场景,编写可配置的转换脚本,确保财务级数据准确。
•通过分区裁剪与并行管道优化,将全量日跑批时间从6小时压缩至1.5小时,大幅提升数据出仓时效。
实时计算平台ETL能力升级 - 高级ETL开发工程师
2021.05-2022.08
•参与公司数据中台实时化改造,负责将部分离线T+1链路替换为Flink流批一体方案。
•设计多级容错与端到端一致性保障机制,解决实时数据与离线报表的数值差异问题。
•搭建基于Prometheus和Grafana的ETL健康度看板,实现任务延迟、数据量波动的秒级预警。
•该平台上线后,核心指标产出延迟从小时级降至分钟级,有力支持了活动期间的实时决策。
对数据流编排与清洗有天然的热情,习惯反复推敲每个节点的效率与健壮性,坚信好的数据管道能无声支撑业务决策。做事沉稳、注重细节且自我驱动,面对复杂转换和异常总能沉到根因。具备扎实的ETL/Hadoop/Spark实战功底,尤其擅长性能调优与大型平台规划;沟通直接高效,乐于带团队啃硬骨头,希望在数据工程领域持续深耕,做出高质量的数据底座。
数据架构与性能优化实践:
掌握数据湖、湖仓一体架构设计理念,曾主导某中型电商历史数据迁移项目,通过分区裁剪与索引重构建,使得核心查询性能提升40%。
熟悉SQL优化、执行计划分析,在日常运维中通过慢查询诊断与参数调优,将数个T级数据仓库的凌晨ETL批处理时长缩短30%以上。