•选修《大规模数据处理技术》《ETL工作流设计与优化》《列式数据库原理》等课程,主导完成“教务财务数据同步管道”课程设计,使用Kettle编排每日增量抽取与转换,实现跨系统数据自动合并,累计处理千万级记录。
•作为技术社团DataLab核心成员,发起“校园实时流数据处理挑战赛”,带领5人团队搭建日志采集、清洗、告警流水线,对校内WiFi接入日志进行滑动窗口异常检测,项目获校级优秀技术实践奖。
•参加全国大学生大数据竞赛,以“实时订单数据流分析系统”作品获省级三等奖,负责Python数据清洗与Flink流处理模块,实现从Kafka消费到OLAP看板的秒级延迟。
北京某数据科技有限公司 - 数据开发部高新技术企业互联网
2016.07-2019.12
ETL数据处理工程师数据管道设计数据清洗与转换批处理调度数据治理
北京
•主导公司核心数据仓库的ETL建设,使用Talend和Kettle开发数据管道,完成从业务系统(交易、用户中心、营销平台)到数据仓库的抽取、清洗与加载,日均处理数据量达千万级。
•与产品及运营团队协作,梳理会员、订单、活动等数据域口径,设计星型模型与宽表,支撑多维分析报表与用户画像,数据一致性提升至99.5%。
•系统优化ETL任务调度,通过拉链表、增量抽取与并行分片,将全量数据加载时间由6小时压缩至2小时,并建立失败自动重试与告警机制。
•搭建数据质量监控体系,编写校验脚本检查空值、重复与业务规则违规,将数据问题发现率提升70%,并输出清洗报告推动业务系统修正。
•撰写ETL设计文档、数据字典与运维手册,规范代码提交与日志规范,确保新成员可在1周内独立接手维护任务。
北京某金融信息服务公司 - 数据工程中心金融科技创新企业
2020.01-至今
资深ETL数据处理工程师数据架构设计技术预研性能调优团队领导
北京
•带领5人ETL小组,负责公司风控与征信数据中台的规划与交付,制定开发排期与代码评审制度,保证多个项目并行推进且零延期上线。
•引入Apache Airflow与DataX作为新一代数据集成方案,替换原有陈旧工具,统一调度与监控,整体开发效率提升40%。
•深入理解反欺诈、信用评分等业务场景,设计复杂衍生变量计算逻辑与实时特征工程流程,支撑决策引擎毫秒级调用。
•推动数据仓库从集中式架构向基于Hadoop的分布式分层架构演进,实现冷热数据分离,数据查询性能提升3倍,系统可用性达到99.9%。
•定期组织技术分享与内部培训,指导2名初级工程师成长为独立模块负责人,建立团队技能矩阵与成长路径。
•参与公司会员数据融合项目,负责从CRM、交易系统、小程序等多个触点抽取会员行为数据,进行去重、归一化与合并,加载至CDP平台。
•设计数据转换规则,处理跨渠道身份识别与数据冲突,通过置信度算法解决重要字段不一致问题,保证会员360视图的准确性与完整性。
•建立会员标签体系,基于消费频次、偏好品类、活跃度等维度生成动态标签,供营销自动化平台进行精准推送与活动圈人。
•项目上线后,会员数据准确率提升至95%,营销活动转化率较之前提高15%,并节省了运营人员手工整理数据的时间。
•负责风控数据实时处理管道的ETL开发,从交易系统、设备指纹、黑名单库等实时抽取数据,通过Kafka与Flink进行流式处理。
•设计风控指标计算逻辑,将原始事件流转换为近24小时滚动统计特征、历史行为序列特征等,满足风控策略对实时计算的时效要求。
•建立数据质量监控与延迟告警机制,对关键字段缺失、数值突变等异常进行实时拦截,并自动触发补偿流程,降低风险漏判率。
•项目上线后,风控数据准备时间从2小时缩短至30分钟,风险识别响应速度提升60%,显著支撑了业务实时决策。
主流ETL工具(Talend、Kettle、DataX、Apache Airflow) 关系型数据库管理与SQL优化(PostgreSQL、MySQL、Oracle) 自动化脚本与数据处理(Python、Shell、批处理) 智能数据巡检与自动修复系统:
负责智能数据巡检系统的核心开发,面向公司数仓ETL任务链,通过定制化监控引擎实时扫描上百张核心表,利用滑动窗口统计字段空值率、环比跳变、主键冲突等异常指纹。
设计多级告警策略,集成钉钉与飞书通知,同时内嵌自动修复触发器,对常见重复导入、增量缺失问题执行预置脚本回滚或补数,修复成功率超过85%。
系统上线后,数据断流告警响应时间从30分钟缩短至2分钟,数据完整率提升至99.9%,成为运维团队日常数据质量保障的核心工具。