AMAZING RESUME
牛敬业
188****0312niu****@***.com北京30男大数据测试开发工程师在职北京25k-35k •率队参加全国大学生数学建模竞赛,聚焦数据清洗与模型交叉验证环节,通过反复对比预测值与真实标签的偏差,养成了严谨的数据质量校验与异常定位习惯。
•发起校内数据测试兴趣小组,主导基于Python+Spark的校园WiFi日志质量分析项目,独立设计了自动化数据一致性对比脚本,从采样、转换到结果比对全流程覆盖,初步构建了大数据测试的工程思维。
•选修《软件测试方法》与《流计算技术》,以“基于Flink的实时数据质量监控平台”作为毕业课题,实现了一套可配置的数据校验规则引擎,通过状态比对与延迟监控,为数据管道提供了端到端的质量保障方案。
大数据测试开发工程师数据平台测试测试框架研发质量工程
北京
•负责美团数据中台的整体测试策略,主导了数据湖架构下离线与实时数据链路的端到端一致性校验框架设计,覆盖PB级用户行为数据。
•研发了基于流式处理的自动化数据对账工具,每日自动比对上百组数据表,将数据质量问题的发现时间从小时级缩短至分钟级,并建立了异常根因自动分析流程。
•与数据开发团队深度合作,推动Spark作业的单元测试与集成测试规范,编写了基于ScalaTest和Mockito的测试套件,将核心模块的代码覆盖率提升至85%以上。
•引入混沌工程实验,对数据管道进行网络延迟、节点故障等异常注入测试,验证了系统在峰值压力下的容错与恢复能力,并输出了高可用改进建议。
大数据测试工程师数据集成测试数据流验证测试基础设施
北京
•在百度,我深度参与了广告数据仓库的ETL全流程测试,针对数据抽取、多表关联和聚合逻辑编写了上千条精细的SQL校验脚本,确保数据准确率达到99.99%。
•独立搭建了集成Hadoop、Hive、Presto的测试环境,并维护每日自动化回归测试套件,通过Jenkins流水线实现定时触发,减少了回归测试的人力投入。
•定期输出数据质量评估报告,为业务方提供多维度数据可信度评分,并推动修复了数个因数据倾斜导致的作业延迟问题,使数据产出时间提前了30分钟以上。
•与产品团队紧密沟通,将复杂的业务指标转化为可测试的数据质量规则,建立了30余个核心指标的监控看板,实现了数据异常的可视化告警。
•该平台基于Flink与Kafka构建,每日处理数十亿条用户行为日志,为业务方提供实时用户画像标签。
•我担任测试开发工程师,主导设计了基于Docker的测试环境,并开发了数据模拟生成器来模拟高并发、乱序的数据流场景。
•通过引入Prometheus与Grafana监控,实现了对作业吞吐量、延迟和GC压力的实时观测,并定位了因序列化方案不当导致的性能瓶颈,优化后系统的吞吐量提升了35%。
•建立了数据质量资产库,沉淀了100余条通用的数据质量检查规则,覆盖了完整性、唯一性、一致性等维度,确保画像标签的准确可靠。
•该项目是一个用于实时处理广告曝光、点击、转化数据的流处理系统,为广告投放策略引擎提供数据支撑。
•我负责构建端到端的数据完整性测试方案,通过对比Kafka源数据与入库后的明细数据,确保在海量数据下零丢失。
•开发了基于Python的自动化数据校验工具,能够自动比对上下游数据并生成差异报告,在数据异常时触发钉钉告警。
•为验证系统的低延迟特性,设计了阶梯式压力测试场景,并协助开发团队优化了窗口计算逻辑,使99分位延迟从800ms降至500ms。
对数据质量有着近乎偏执的追求,享受从海量、复杂的数据链路中揪出隐蔽缺陷的成就感,坚信测试是数据价值的守门人。习惯以严谨的系统思维拆解问题,对数据一致性与逻辑漏洞保持高度敏感,不放过任何异常波动。擅长利用脚本与自动化框架提升验证效率,能深入理解离线与实时计算引擎的运作机制,从测试视角反向推动数据架构与流程的优化。乐于在跨职能协作中充当数据品质的布道者,持续探索更具前瞻性的质量保障方法,期待在数据密集型场景中让每一份数据都可信、可用。
数据质量工程与测试实践:
热衷于探索数据管道的质量保障手段,擅长利用Apache Griffin与自研校验框架构建数据质量监控,曾对亿级数据集进行一致性比对优化,并编写基于Flink的状态对账脚本,为实时流处理链路提供精准的异常检测能力。