AMAZING RESUME
188****0711niu****@***.com北京28男大数据开发测试工程师在职北京20k-30k •夯实计算机基础理论,在《数据挖掘导论》课程中首次接触大数据处理,独立完成基于协同过滤的图书推荐系统,并撰写对比实验报告,获得优秀课题。
•加入校内开源技术社团,参与组织Hadoop技术沙龙,与同学共同搭建小规模集群实验环境,探索MapReduce任务调优,积累早期大数据实践。
•作为队长参加校级“互联网+”创新大赛,负责后端架构设计与数据库优化,带领团队实现一个校园二手交易平台,获得二等奖,锻炼了项目管理和快速排错能力。
大数据开发测试工程师数据管道测试自动化框架演进
北京
•制定数据仓库分层测试策略,针对ODS、DWD、DWS各层设计数据一致性核对方案,并研发自动化比对脚本,将回归测试耗时缩短40%。
•深入广告投放数据流,验证实时竞价日志的采集、解析至聚合的全链路正确性;主导千亿级数据的抽样校验逻辑,确保点击、曝光等核心指标偏差小于0.1%。
•推动测试左移,在需求评审阶段引入数据模型测试用例,提前暴露字段映射、枚举值缺失等设计缺陷,降低开发返工率。
•基于PySpark开发数据质量监控工具,自动探测分区数据量波动、空值率异常,并接入告警平台,实现离线数据质量7×24小时巡检。
•定期组织技术复盘,梳理数据质量问题根因,输出《大数据测试避坑指南》,帮助团队系统性规避历史缺陷。
•设计并落地了一套面向Flink实时作业的测试框架,支持事件时间语义下的端到端验证,有效覆盖双流JOIN、窗口聚合等复杂场景。
•深入供应链预测系统测试,构造多维度历史销量与特征数据,验证特征工程流水线及模型训练结果的正确性,保障销量预测准确率达标。
•搭建混沌工程实验环境,模拟HBase RegionServer宕机、Kafka分区Leader切换等故障,验证数据管道的容错与自动恢复能力。
•主导测试团队技能图谱建设,面向组内开展《SQL高级调试技巧》、《Spark执行计划解读》等系列培训,提升整体数据测试水平。
某物流平台运力调度实时数据仓库测试 - 测试负责人
2019.03-2019.09
•项目背景:该系统基于Lambda架构,利用Kafka+Flink+Hudi构建实时数据仓库,为运力调度提供实时的订单、车辆位置及路况指标。
•我的职责:设计实时与离线数据一致性验证方案,通过构造基准测试数据并注入Kafka,比对Hudi表与离线Hive表的最终结果,确保端到端数据准确。针对高峰期每秒百万级订单事件,使用JMeter配合自定义Flink压力测试脚本,模拟运单风暴,评估系统背压与消费延迟,推动优化数据分区策略。
•项目成果:发现并协助修复了水位线传播延迟导致的窗口计算错误,使实时指标与离线T+1核对准确率达到99.95%;优化后系统吞吐量提升2倍,P99查询延迟降低至500ms以内,有力支撑了“双11”等高峰时段的运力调度决策。
•项目背景:项目基于Aliyun EMR搭建数据湖,汇集APP埋点及交易日志,用于构建用户风险画像及个性化理财推荐。
•我的职责:负责埋点数据接入层的格式校验和ETL清洗测试,设计规则库测试数千条正则清洗逻辑,确保URL解码、JSON解析无误。对Spark MLlib训练的风控模型进行特征一致性测试,通过构造影子模型对比生成的特征向量,防止特征穿越。主导数据脱敏测试,验证手机号、身份证等敏感字段在DWS层的加密存储与访问权限控制。
•项目成果:通过测试拦截了多起因日志格式变更引发的数据缺损,将数据可用性从96%提升至99%;发现并修复特征工程环节的日期偏移缺陷,保障了模型训练的时效性;确保数据湖通过金融合规验收,为精准风控与营销提供了高质量的数据底座。
我对大数据技术栈充满好奇,享受从海量数据流转中揪出隐藏缺陷的成就感;工作中坚持严谨细致,习惯用自动化思维替代重复劳动,对数据一致性、性能瓶颈有天然敏感。熟练运用JMeter、Selenium、Postman等工具构建测试框架,熟悉Hadoop/Spark等生态的常见测试场景。乐于在跨团队协作中充当质量桥梁,善于用简洁的技术语言同步风险,希望持续在大数据测试领域深耕,为稳定可靠的数据产品保驾护航。
大数据测试方法论沉淀:
坚持研读国际大数据测试会议论文(如SIGMOD、VLDB的工业专题),重点跟进数据质量监控与异常检测的前沿方法,定期在内部Wiki发布《大数据测试洞察》专栏,分享对Diff测试、机器学习驱动的测试用例生成等技术的实践心得,推动团队技术视野与专业壁垒的提升。