•参加校级数据挖掘挑战赛,获得一等奖,独立完成多源日志的清洗、维度建模与报表输出,显著提升了数据可用性。
•在计算机协会负责技术布道,策划并主讲过“数据同步工具选型”主题分享,演示了DataX、Canal等工具在实际场景下的调优技巧。
数据仓库ETL开发工程师ETL流程设计数据建模SQL优化Python数据处理数据质量监控
北京
•为物流业务搭建数据仓库ETL管道,处理每日千万级运单与路由数据,通过SQL脚本与Python调度实现自动化清洗、聚合与入库。
•与运营团队紧密配合,梳理配送时效、签收率等核心指标口径,设计星型模型,支撑实时大屏与多维报表。
•在ETL环节嵌入数据完整性、一致性校验规则,将数据异常发现时间从小时级缩短至分钟级,大幅降低脏数据影响。
•定期对数据仓库进行分区裁剪、索引优化与SQL重写,保障查询在数据量增长30%的情况下响应时间基本持平。
北京云帆信息技术有限公司 - 数据研发部信息技术服务
2019.07-2021.08
资深数据仓库ETL开发工程师数据仓库架构Spark批流一体团队管理性能调优技术规范
北京
•主导零售行业数据中台建设,带领5人团队完成从0到1的ETL体系搭建,采用Spark批处理与Flink实时流混合方案,实现全域数据融合。
•设计数据分层架构,优化宽表生成逻辑与预计算策略,将核心报表产出时间提前2小时,并降低计算资源开销。
•推动团队引入列式存储格式与数据湖方案,使即席查询延迟降低60%,并制定ETL开发规范与代码审查机制。
•定期组织内部技术分享,进行SQL性能调优、数据模型设计等专项培训,帮助初中级成员快速成长。
•从订单系统、运输管理系统、GPS等数据源抽取并清洗包裹、路由、签收等数据,构建物流全链路宽表。
•处理数据倾斜与异常轨迹,开发ETL脚本实现数据标准化,支撑时效分析、运力调度等场景。
•通过增量抽取与并行处理,将数据刷新周期从4小时缩短至1.5小时,提升运营看板时效性。
•与业务分析团队合作,开发多维分析报表,辅助运营团队识别瓶颈网点、优化配送路线。
•负责零售数据中台ETL模块,整合线上商城、线下门店及供应链数据,统一数据维度与粒度。
•开发复购率、客单价、库存周转等复杂指标的计算逻辑,利用Spark实现高效聚合与汇总。
•构建数据质量监控体系,在ETL流程中嵌入商品、交易数据的完整性、准确性校验,确保合规。
•与数据科学团队协作,构建用户画像、商品推荐所需的数据集市,为挖掘模型提供高质量数据底座。
数据集成调度实践:
熟练使用DataX与Kettle构建异构数据源同步管道,曾设计增量抽取方案,将Oracle到ClickHouse的日同步延迟缩短至分钟级。
在数据仓库项目中,利用Airflow编排多层ETL任务,结合自定义监控脚本实现脏数据自动拦截,保证下游报表的准确性。