•在“大数据分析实践”课程中,带领小组搭建基于Spark的电商用户行为分析流水线,独自完成从MySQL、日志文件到Hive的ETL脚本开发,清洗超50万条脏数据并实现增量更新,最终产出用户画像看板,获课程最佳项目奖。
•担任数据库原理课程助教期间,协助设计实验题目并批改SQL优化作业,针对学生常见的数据倾斜、索引失效等问题整理出《SQL调优避坑指南》,锻炼了问题定位与技术文档撰写能力。
北京某数据技术服务有限公司 - 数据平台部数据技术服务
2014.07-2017.12
•主导公司供应链数据仓库ETL开发,使用Talend对ERP、物流及仓储系统数据进行抽取、清洗与转换,支撑采购和库存分析。
•深度参与供应链数据仓库的需求建模与分层设计,将交易明细、运输轨迹、供应商主数据等模块标准化,形成统一的分析视图。
•重构核心ETL作业,通过分区并行与增量抽取策略,将每日批处理时间从5小时压缩至2.5小时,显著降低数据延迟。
•与供应链运营团队建立数据质量反馈闭环,制定数据校验规则,确保关键指标(如库存周转率)的数据准确率超过99.5%。
高级ETL开发工程师流式数据处理数据治理实时ETL
北京
•带领3人小组负责公司实时数据湖仓的ETL开发,以Apache Airflow为调度中心,结合Spark Structured Streaming处理物联网设备日志和用户行为流。
•设计并实现数十套复杂数据转换逻辑,整合MySQL、MongoDB、Kafka及半结构化日志文件,构建统一的事实表和维度表。
•优化数据管道吞吐,通过动态分区、异步IO和背压机制,将日处理数据量从3亿条提升至12亿条,峰值吞吐达800万条/分钟。
•主导制定数据质量标准与清洗规则,参与公司数据治理项目,引入数据血缘追踪和异常自动告警,推动数据资产目录的落地。
•为支撑公司供应链全链路分析,构建集成了ERP、WMS、TMS及供应商门户的企业数据仓库,覆盖采购、库存、物流及财务成本主题。
•负责核心ETL开发,基于Talend对多源异构数据进行抽取、清洗与标准化,处理了超过200张源表的海量历史数据。
•设计了多层数据转换流程,包括缓慢变化维处理、供应链指标计算及异常数据回补机制,确保数据一致性和可追溯。
•通过优化并行度和负载均衡,将每日全量批处理时间由6.5小时缩短至3小时,为业务提供更及时的日报和看板。
•与数据架构师协作定义数据质量规则,在ETL过程中嵌入完整性、唯一性和一致性校验,大幅提升供应链数据可信度。
实时数据湖仓一体建设项目 - 高级ETL开发工程师
2018.01-2019.12
•为应对海量实时数据需求,搭建公司级数据湖仓平台,集成手机App埋点、IoT传感器、在线交易等流式数据,支撑实时大屏和推荐系统。
•作为ETL组长,统筹技术选型与开发,使用Apache Airflow编排复杂任务流,利用Spark Structured Streaming实现实时ETL,并借助Kafka解耦数据管道。
•设计统一的数据模型,处理关系型数据库、NoSQL、JSON及Avro文件等多种格式,实现近实时的维表Join和聚合。
•通过数据倾斜处理、自适应查询执行和内存优化,将管道吞吐从200万条/小时提升至850万条/小时,满足高并发场景。
•深度参与数据治理,引入数据质量仪表板,定义完整性、时效性等指标,并建立数据清洗规则库,支撑数据资产的高质量交付。
数据质量与自动化监控:
深入理解数据质量评估体系,能够针对不同业务场景独立设计校验规则与清洗策略,曾在一项金融实时计算项目中负责跨系统对账与数据一致性检测,通过规则引擎将核心指标差错率控制在0.1%以下。
擅长构建数据质量监控看板,利用Airflow与Python脚本实现异常数据自动感知、告警及归档,将数据异常的平均发现时间从小时级缩短至分钟级,并输出质量周报辅助团队复盘。