188****7368niu****@***.com北京30男ETL开发工程师在职北京15k - 25k •组队参加全国大学生数学建模竞赛,获得省级一等奖,负责从公开数据集提取特征与清洗脏数据,锻炼了数据预处理与ETL逻辑。
•主导校级项目“教室节能灯管数据分析平台”,负责从传感器采集数据到数据库ETL流程设计,使用Python进行数据清洗,初次接触数据仓库建模。
•选修《数据仓库与数据挖掘》课程,基于Kettle完成零售销售数据的ETL与多维分析,激发了对数据管道的兴趣。
•加入校智能交通实验室,负责GPS轨迹数据去重与异常值处理,认识到数据质量对分析结果的关键影响。
北京某数据科技有限公司 - 数据研发部高新技术企业数据服务
2015 - 07-2018 - 12
ETL开发工程师数据集成数仓分层SQL优化DataStage
北京
•负责公司零售行业数据中台的ETL实施,使用DataStage与Kettle工具完成多源异构数据的抽取、清洗与融合。
•参与星型模型与雪花模型的设计讨论,针对毛利分析、会员画像等主题优化维度表结构,提升即席查询响应速度。
•深入与运营、财务部门对接,将业务指标翻译为数据逻辑,设计并交付自动化日报、周报看板,降低人工取数压力。
•处理大量POS流水与线上订单数据,编写去重、异常值过滤、地址标准化等清洗规则,确保数据一致性达99.9%。
•编写ETL作业调度脚本,利用分区表与索引优化进行性能调优,将核心作业执行时间缩短40%。
•参与数据仓库从0到1的搭建,编写测试用例并组织UAT,对新员工进行数据开发规范与Informatica PowerCenter的入职培训。
北京某互联网公司 - 大数据研发部互联网大厂大数据
2019 - 01-2021 - 06
资深ETL开发工程师离线数仓Spark ETL数据治理Airflow
北京
•带领4人小组负责广告投放数据仓库的ETL建设,制定分阶段交付计划与技术选型,从零搭建分层架构。
•主导ETL工具链升级,从传统Informatica迁移至Spark+Airflow方案,引入DataHub作为元数据管理,提升开发效率30%。
•重构数仓DWD层,采用增量快照与拉链表处理广告曝光、点击等海量日志,解决历史数据回刷的性能瓶颈。
•针对每日TB级增量数据,设计并行处理与分区裁剪策略,将广告效果归因链路的计算时间从小时级降至分钟级。
•与数据治理委员会协作,落地数据质量监控体系,制定命名规范、血缘追踪与SLA告警,数据可信度大幅提升。
•定期组织内部技术分享,指导初中级工程师掌握Spark SQL调优与Hive数据倾斜处理,团队整体交付能力显著增强。
•参与公司零售会员数据仓库建设,负责会员主题域的ETL全流程开发。
•从CRM、微信小程序、门店POS等多个数据源抽取会员基础信息、积分流水、消费行为等数据。
•进行多渠道数据清洗,处理账户合并、手机号去重、地址归一化等复杂逻辑,形成统一会员ID。
•设计会员画像宽表的转换逻辑,将消费频次、偏好品类、流失预警标签等指标加工入库。
•加载数据至ODS与DWD层,并编写数据质量校验脚本,监测数据完整性与及时性。
•项目上线后,营销部门可快速圈选客群,精准营销活动响应率提升45%,为会员精细化运营提供了可靠数据底座。
•负责公司物流数据中台项目的ETL架构设计与核心开发,覆盖仓配、运力、履约等全链路。
•整合OMS、WMS、TMS系统中的订单、库存、运单、轨迹等数据,打通物流信息孤岛。
•设计复杂转换规则,将各系统状态码标准化,实现包裹旅程的端到端追踪。
•开发基于Spark的增量ETL流程,处理每日数千万条物流轨迹,利用广播变量优化关联合并。
•与业务团队共建物流时效监控看板,提供延误预警、妥投率分析等自助式数据产品。
•上线后,物流全链路数据可视度提升,异常订单定位时间缩短70%,库存周转率提高30%。
对数据管道构建有种执念,享受把散落各处的原始信息梳理成规整、可用的资产,让数据在企业里顺畅流动;做事细致,对数据一致性有洁癖,习惯在清洗规则和转换逻辑上反复推敲,不放过任何可疑的异常值。精通 SQL 与存储过程,熟悉维度建模和分层数仓设计,能快速将业务口径转成高性能的 ETL 作业;跨部门沟通时善于把需求翻译成技术语言,在性能调优和调度编排上持续打磨,追求稳定、可回溯的交付。
ETL与大数据技术栈:
熟悉Hadoop生态系统,包括HDFS、Hive、Spark,能够利用Spark SQL对结构化/半结构化数据进行清洗、转换和聚合,处理过TB级日志数据。
掌握MapReduce编程模型,理解数据倾斜和shuffle调优,曾开发过针对用户行为日志的分布式ETL任务,实现数据清洗与分区存储。