牛敬业
人工智能测试工程师
188****7476niu****@***.com北京30男人工智能测试工程师在职北京20k-30k •主修《软件测试与质量保证》《机器学习》《模式识别》等课程,系统构建了AI模型测试与评估的知识体系。
•作为视觉组核心成员参与全国大学生机器人大赛RoboMaster,负责目标识别模块的鲁棒性测试,通过构造对抗样本集与边界条件用例,提升模型在复杂环境下的稳定性,团队获中部赛区一等奖。
•独立负责校园AI助手应用的测试设计,编写自动化脚本覆盖语音唤醒、意图识别等关键场景,运用Monkey测试与性能监控工具定位内存泄漏与响应延迟,并输出规范的测试报告。
北京智谱华章科技有限公司 - 人工智能测试部AI大模型独角兽AIGC领域领先
2017.07-2021.06
人工智能测试工程师AI对话测试功能验证压力测试安全合规
北京
•在公司主要负责AI对话系统与推荐引擎的测试工作,参与多个核心项目的测试策略制定,覆盖功能验证、压力测试、稳定性与安全合规测试。
•- 功能测试方面,针对语义理解、多轮对话、意图泛化等模块编写了高覆盖率的测试用例,结合手工探索与pytest自动化脚本,累计发现并推动修复缺陷200+,缺陷关闭率超过97%。
•- 性能测试中,运用Locust模拟高并发对话请求,系统性分析响应延迟、GPU利用率与内存泄漏点,提出的优化建议使对话平均响应时间降低35%,并发处理能力提升40%。
•- 兼容性测试时,覆盖主流安卓、iOS版本及鸿蒙系统,并针对不同音频设备与网络环境进行组合测试,确保产品在各类端侧场景下稳定运行。同时与算法、工程团队每日站会同步风险,缩短问题闭环周期。
商汤科技开发有限公司 - 人工智能测试团队AI算法平台公司视觉领域头部企业
2021.07-2023.06
高级人工智能测试工程师测试团队管理计算机视觉测试自动化框架搭建模型鲁棒性评估
北京
•在新公司负责带领5人测试小组,主导计算机视觉与多模态产品的质量保障工作。
•- 制定并落地了团队统一的测试流程与质量看板,引入xmind+飞书文档进行测试设计评审,使测试用例复用率提升50%。定期组织AI测试技术分享,提升团队在对抗样本测试、模型鲁棒性评估方面的能力。
•- 深度参与公司核心视觉平台的测试,设计包含图像分类、目标检测、OCR在内的端到端测试方案。主导搭建了基于PyTorch与Selenium的自动化回归体系,将核心场景自动化覆盖率提升至65%,回归测试周期从3天缩短至4小时。
•- 对线上badcase进行根因分析,结合用户反馈构建测试数据集,驱动模型迭代。与产品、算法同事紧密协作,担任质量门禁,保障了多个大版本按时发布,项目交付及时率保持100%。
•- 作为测试工程师,负责制定涵盖召回、排序、冷启动策略的测试计划。功能测试中,对推荐位的多样性、实时性、个性化程度进行验证,通过A/B测试和离线评估,发现并协助修复了推荐结果同质化问题,使推荐点击率提升18%。
•- 性能测试时,模拟大促流量洪峰,测试推荐服务的TPS和资源消耗,提出缓存策略优化建议,使99分位响应时间缩短22%。易用性方面,收集运营人员反馈,推动后台配置界面简化,提升了运营效率。最终产品平稳上线,支撑了核心业务增长。
•此项目为基于NLP的智能客服质检与情绪分析系统。
•- 参与全生命周期测试。需求阶段,与产品经理对齐质检规则和情绪标签定义,提炼测试要点。设计阶段,编写了语音转写、意图识别、风险预警等功能的测试用例,并构建了涵盖客服、金融、政务行业的测试语料库。
•- 执行测试中,发现了转写引擎对方言的识别偏差、情绪模型对微弱愤怒的漏判等问题。针对方言适配,协助算法团队补充训练数据,使方言转写准确率提升12%;针对情绪漏判,提出引入上下文情绪传播特性,方案被采纳。
•- 进行了多轮模型迭代的回归测试,保障了系统在复杂语料下的稳定性。上线后,质检效率提升60%,客户投诉率下降25%。
对人工智能系统的行为不确定性与质量风险始终抱有探索欲,乐于在模型推理、数据漂移等复杂场景中挖掘隐蔽缺陷。具备严谨的逻辑分析和批判性思维,习惯从用户视角审视产品,捕捉那些容易被算法忽略的边缘体验。编程基础扎实,能灵活运用自动化测试框架,针对模型、数据和接口快速搭建分层测试策略。沟通节奏明快,善于在跨角色协作中理清需求,用测试数据推动质量共识。希望持续深耕AI测试,在智能产品可靠性上做让人信赖的守门人。
AI测试工具链与自动化构建:
持续探索AI测试工具链,在个人项目中搭建基于Docker的模型服务测试环境,引入Pytest-bdd实现行为驱动测试。熟练使用Selenium Grid与Appium进行移动端视觉回归的分布式执行,并自定义Locust脚本模拟高并发语音交互,分析模型推理瓶颈,优化端到端延迟。