AMAZING RESUME
牛敬业
资深数据测试工程师
188****7402niu****@***.com北京32男资深数据测试工程师在职北京25k-35k •参与‘城市交通数据清洗’校企合作项目,使用PySpark处理日均500万条轨迹数据,提出异常值检测算法使数据可用率提升22%
•在《大数据系统实践》课程中设计分布式ETL测试方案,通过模拟数据倾斜场景验证Spark作业容错能力,获课程最高分
•组建数据挖掘兴趣小组,带领团队完成‘校园外卖订单预测’项目,用随机森林模型实现订单量预测准确率88%
•主导多源异构数据平台的测试策略制定,设计覆盖实时流批处理的数据验证方案,通过自定义SQL校验脚本保障核心指标一致性
•建立数据缺陷分级响应机制,协同开发团队将关键数据问题平均修复周期压缩至4小时内,缺陷闭环率达98%
•开发基于Python的数据回归测试工具链,实现异构数据源(Kafka/ES/ClickHouse)的跨平台校验,测试执行效率提升40%
•编写数据质量白皮书并推动跨部门评审,协助建立数据变更影响评估流程,减少因数据变更引发的线上事故60%
•统筹5个并行数据中台项目的测试资源调度,构建分层测试策略应对千万级数据量场景,确保季度交付目标100%达成
•创新性引入数据血缘追踪技术,将测试覆盖率从常规85%提升至行业领先的97%,漏测率同比下降70%
•搭建数据测试知识库并开展6期专项培训,培养出3名可独立负责数据架构测试的骨干成员
•主导制定《数据质量评估标准》,推动建立数据问题根因分析制度,使数据质量投诉量连续3季度环比下降25%
•针对医疗影像存储系统的多模态数据特性,设计DICOM文件与结构化数据的联合校验方案
•构建包含800+检查项的测试矩阵,覆盖患者主索引、检验报告、用药记录等核心数据域
•发现并修复3个跨系统数据同步延迟问题,避免潜在医疗数据不一致风险
•通过混沌工程验证灾备切换场景下的数据完整性,保障平台通过等保三级认证
•设计面向实时物流轨迹数据的流式测试方案,验证Kafka Streams处理百万级订单数据的准确性
•开发自动化校验平台,实现GPS坐标、时效指标、异常事件等12类数据的每日批量验证
•建立数据质量SLA监控看板,将数据延迟告警响应时间从2小时缩短至15分钟
•输出《物流数据测试规范》,推动测试标准在3个业务线落地,数据返工率下降45%
对数据质量有着近乎偏执的执着,坚信‘脏数据是系统疾病的早期信号’。习惯用代码思维拆解数据链路,擅长在复杂业务场景中定位隐藏的数据逻辑漏洞。日常会花20%时间研究新型数据校验算法,保持对分布式数据架构的敏感度。追求测试方案的可复用性,认为自动化不是目的而是手段。持续积累金融/医疗等强合规行业的数据治理经验,期待在更严苛的数据环境中验证技术深度。
数据验证工具(如Great Expectations、dbt) 分布式存储测试(HDFS/HBase/ClickHouse) 数据血缘追踪系统:
精通基于Airflow的DAG工作流设计,可快速搭建数据任务依赖关系可视化平台
擅长通过血缘图谱定位数据异常根因,曾协助团队在2小时内完成跨17个系统的数据问题追溯