•参加全国大学生大数据竞赛,负责日志数据清洗与特征工程,使用Python与SQL实现自动化ETL流程,团队获省级二等奖。
•在数据库课程设计中,基于PostgreSQL搭建了电商订单数据仓库,设计星型模型并编写ETL脚本,实现每日增量数据抽取与加载。
•加入校园运维兴趣小组,协助管理校内Linux服务器,配置cron作业实现数据备份与日志轮转,积累了自动化运维习惯。
ETL数据管道工程师数据管道开发流批一体处理数据质量自动化
北京
•负责企业级数据中台ETL管道的建设与维护,基于Java和Apache Beam开发数据摄取与转换模块,实现从CRM、ERP、IoT设备等多源异构系统到云数据仓库的准实时同步。
•重构核心批处理作业,将每日增量数据合并窗口由15分钟缩减至2分钟,并使CPU资源消耗降低25%,大幅提升了管道吞吐能力。
•与产品、运营及数据科学团队定期对齐数据需求,主导物流领域数据模型设计,将配送时效、仓储周转等关键指标的计算逻辑固化在管道中,确保数据口径一致。
•搭建自动化数据质量监控平台,通过自定义Profiling规则与异常检测算法,对空值、漂移、重复等发起实时告警,推动数据治理闭环,使数据有效率达到99.5%。
云帆智联信息技术有限公司 - 数据工程部行业领先企业
2019.01-至今
高级ETL数据管道工程师实时数据架构技术团队管理存储与查询优化
北京
•主导公司下一代数据集成平台的架构设计与核心管道实现,采用Flink+Doris构建实时数仓链路,支撑日均数十亿条交易日志的稳定入仓和即席分析。
•带领5人小组完成保险、零售等多个行业的客户数据整合项目,统一数十个外部API与文件接口的数据接入标准,形成可复用的连接器库。
•重新规划数据存储分层,引入列式压缩与冷热分离策略,将历史数据存储成本降低35%,同时使高频查询的P99延迟下降60%。
•撰写《数据管道开发与运维规范》,推广代码模板化与CI/CD实践,组织内部技术分享10余场,显著提升团队交付质量和工程化水平。
•参与公司与某大型保险集团合作的数据中台项目,负责ETL条线开发。
•从承保、理赔、呼叫中心等15个业务库抽取保单、报案、通话记录等数据,进行复杂的清洗与标准化(如理赔状态码统一、地址模糊匹配、车险标的信息格式转换)。
•设计增量拉取与全量快照结合的加载策略,采用拉链表模型管理客户历史状态,确保数据仓库可追溯。
•交付后,保险公司的客户360视图生成效率提升50%,支撑了精准营销和反欺诈相关应用。
零售连锁经营分析数据仓库项目 - ETL开发工程师
2019.03-2019.09
•负责某零售连锁品牌全国门店数据仓库ETL开发项目。
•从POS系统、线上商城、会员系统等抽取销售流水,通过Python UDF实现促销分摊、毛利计算、会员生命周期标签等复杂业务逻辑。
•构建面向区域经理、品类经理的汇总数据集市,预聚合库存周转率、坪效等指标。
•项目上线后,区域运营团队的数据获取时间从数小时缩短至分钟级,为门店调货、促销决策提供了实时数据支撑。
数据管道调度与监控(Airflow/DolphinScheduler) 云原生数据仓库建模(Snowflake/Redshift) 可弹性伸缩的ETL管道编排:
擅长基于Docker与Kubernetes编排ETL工作流,通过Helm Chart管理数据管道服务,实现计算资源按需分配。曾设计一个基于Airflow on K8s的日志采集管道,将每日10TB数据从Kafka消费、清洗后写入ClickHouse,并通过HPA自动应对流量高峰,管道吞吐量提升30%。