AMAZING RESUME
牛敬业
深度学习优化工程师
常怀探索之心,以实干沉淀自身价值
188****2372 niu****@***.com 北京 28 男 深度学习优化工程师 在职 北京 30k-40k • 硕士期间专注于高性能计算与体系结构方向,主修《并行计算导论》《计算机体系结构》等核心课程,GPA 3.7(满分 4.0)。积极参与开源社区贡献,为某主流深度学习框架提交算子优化 Patch 并被合入主分支,积累了扎实的底层代码调试与性能分析能力。
• 担任校 ACM 程序设计竞赛集训队技术顾问,指导低年级同学优化算法复杂度与内存管理,多次带队获得区域赛银牌,强化了逻辑思维能力与团队协作精神。
北京字节跳动科技有限公司 - 推荐算法工程部 互联网大厂
2018.07-2021.12
• 负责内容推荐系统核心召回模型的推理加速工作,针对大规模稀疏 Embedding 层进行存储优化,引入哈希分桶与量化感知训练(QAT),在保持 AUC 指标不下降的前提下,将模型显存占用减少 40%,QPS 提升 50%,有效支撑了亿级用户的实时推荐请求。
• 主导自然语言处理意图识别模型的轻量化改造,针对移动端推理场景,对 BERT 基座模型进行动态剪枝与结构重参数化,替换原有的密集连接层为深度可分离卷积,使单句推理延迟降低 60%,成功落地于公司智能客服 APP。
• 建立团队模型性能基准测试流程,整合多版本框架与硬件配置,定期评估模型压缩与加速效果,推动团队引入 ONNX Runtime 与 TensorRT 等推理引擎,提升整体算法落地效率与资源利用率。
• 主导手机影像 ISP 与 NPU 协同优化项目,针对夜景 HDR 多帧融合模型,通过算子融合与内存复用技术,减少中间数据读写开销,在保持画质指标(PSNR 仅波动 1%)的基础上,推理耗时缩短 45%,满足实时预览拍摄需求。
• 搭建端侧 AI 模型性能评估体系,覆盖多代处理器架构与不同内存带宽场景,量化评估模型能效比与热功耗,通过该体系优化了 6 款核心影像模型,平均能效提升 30% 以上,为芯片选型提供数据依据。
• 与底层驱动团队深度协作,针对自研 NPU 架构定制专用算子,解决标准框架不支持的复杂卷积与激活函数问题,使模型在特定硬件上的执行效率提升 50%,助力软硬一体化产品竞争力提升。
• 项目背景:公司电商图片搜索业务流量增长迅速,原有向量检索模型在高峰期响应延迟过高,影响用户购物体验与转化率。
• 项目任务:作为核心成员负责检索模型的工程化加速。对 ResNet 特征提取网络进行 TensorRT 部署优化,利用 FP16 混合精度与层融合技术减少计算图节点,同时引入近似最近邻(ANN)索引算法优化召回环节。
• 项目成果:优化后的系统在保证 Top-10 检索准确率(维持在 95% 以上)的同时,端到端检索延迟降低 60%,成功支撑大促期间千万级并发请求,显著降低了服务器集群的 CPU 与 GPU 资源成本。
• 项目背景:车载语音助手需要极高灵敏度的唤醒词检测,但车机芯片算力有限且功耗敏感,需平衡唤醒率与误唤醒率。
• 项目任务:负责语音唤醒模型的端侧部署优化。对 Transformer 架构进行知识蒸馏,将教师模型能力迁移至轻量级学生模型,并针对 ARM 架构指令集(NEON)进行算子级汇编优化,减少浮点运算开销。
• 项目成果:优化后的模型在车机测试平台上,唤醒响应时间从 200ms 缩短至 80ms 以内,误唤醒率降低至 0.1%/天,已批量搭载于多款智能座舱产品中,提升了用户交互的流畅度与满意度。
常怀探索之心,以实干沉淀自身价值。我是一名对底层技术充满热忱的优化工程师,坚信好的算法不仅要精准,更要高效。具备极强的代码洁癖与性能敏感度,热衷于挖掘硬件潜能,追求在算力受限下的极致表现。熟悉主流深度学习框架与部署工具链,擅长从算子级到系统级进行全链路调优。拥有扎实的计算机体系结构功底,对跨平台部署与异构计算有浓厚兴趣。希望能将技术深度与工程落地相结合,在 AI 基础设施领域持续深耕,推动模型在更多端侧场景的高效运行。
技术社区贡献:
在 CSDN 与掘金平台持续撰写深度学习优化技术专栏,累计输出《模型部署实战》系列文章 20 余篇,获得社区 5000+ 点赞与收藏,帮助众多开发者解决推理引擎配置与算子调试难题,具备优秀的技术总结与知识分享能力。