AMAZING RESUME · VERDANT
牛敬业
ETL数据库开发工程师
188****8083niu****@***.com北京28男ETL数据库开发工程师在职北京20k-30k •修读数据库系统实现、分布式计算等进阶课程,曾基于TPC-H基准完成查询优化实验,获课程最佳报告奖。
•担任校级数据库兴趣小组组长,主导“电商用户行为实时分析”项目,使用Spark SQL构建ETL管道并可视化,获院创新实践二等奖。
ETL数据库开发工程师实时数据同步数据管道优化
北京
•• 负责公司核心广告投放系统的实时与离线数据管道建设,从业务数据库(MySQL、MongoDB)及日志系统采集数据,支撑报表与算法模型训练。
•• 重构关键ETL任务,通过分区裁剪和并行写入将每日全量结算数据处理耗时从1.5小时压缩至30分钟以内,保障了次日10点前的业绩看板准时产出。
•• 与产品运营团队协同定义用户分群与归因分析所需的数据模型,搭建星型模型集市层,降低了50%的临时取数成本。
•• 搭建ETL作业自动化监控与告警体系,定制数据质量稽核规则,使数据延迟与脏数据问题能够在15分钟内被发现并通知责任人。
资深ETL数据库开发工程师数据架构设计流批一体
北京
•• 主导公司大数据资产管理平台的ETL架构演进设计,覆盖离线批处理与流式处理场景,日均稳定处理20TB以上的多源异构数据。
•• 带领4人小组完成支付核心系统从Oracle到云原生数仓的无缝数据迁移,通过全量+增量校验方案保证了5千万用户余额数据的零差错切换。
•• 推动Flink与Iceberg在增量数据处理中的落地,替换原有Spark Streaming方案,使端到端延迟从分钟级降至秒级,并节约了30%的计算资源。
•• 制定数据开发规范与代码审核流程,定期组织内部技术分享,辅导初级工程师,团队交付效率与代码质量明显提升。
跨境物流轨迹数据湖EDW建设 - ETL开发负责人
2018.03-2018.09
•• 项目背景:为公司全球物流业务构建统一的轨迹数据仓库,支撑包裹实时追踪与时效分析。
•• 主导数据采集方案设计,从各地物流服务商API、IoT设备消息队列及内部调度系统抽取数据,日均处理8000万条事件。
•• 设计多阶段转换逻辑,包括轨迹去噪、地点标准化与时效KPI计算,使用UDF与自定义算子实现业务规则灵活配置。
•• 通过数据分层(ODS-DWD-DWS)与列式存储优化查询性能,典型查询耗时从十几秒降至亚秒级。
•• 上线后,业务部门可自助查询任意包裹的完整轨迹与异常预警,物流异常主动发现率提高40%。
保险反欺诈评分卡数据底座项目 - ETL开发工程师
2019.05-2019.12
•• 对接医保数据、第三方征信接口与内部理赔系统,抽取超过300个变量,对缺失率和异常值进行自动化清洗与填补。
•• 制定统一的数据字典与编码规范,解决多源数据口径不一致问题,将数据标准化覆盖率提升至99.9%。
•• 基于维度建模构建反欺诈主题宽表,支持建模团队快速迭代特征,模型训练数据准备时间从3天缩短到半天。
•• 项目成果已应用于车险与健康险的理赔审核流程,可疑案件筛查准确率提升22%,显著降低欺诈损失。
对数据流转与清洗有天然的敏感,享受把杂乱数据梳理成干净、可靠资产的过程;编码上有明确的“数据洁癖”,苛求脚本可读、异常可追踪、性能可度量。善于做跨团队的需求翻译,习惯用可维护的设计替代一次性交付。持续关注数据栈演进,愿意在ETL与数据库开发岗位上长期深耕,让管道稳定地为业务创造价值。
数据治理与质量保障:
在实习项目中主导制定客户主数据标准,借助Informatica实现元数据血缘梳理,保障下游审计报表准确率。
设计自动化数据校验规则与质量评分卡,部署后使核心报表数据异常工单减少70%,显著降低人工排查成本。