•深度掌握计算机体系结构、分布式计算、机器学习系统等硬核课程,多次课程设计获评优秀,并带领团队完成一套轻量级分布式推理引擎原型。
•作为骨干参与国家重点研发计划“异构AI训练系统”课题,负责底层通信与调度模块的设计与性能调优,在校期间即积累了千卡级系统的实战认知。
•负责智能广告平台的系统架构设计与演进,带领团队完成平台重构,使在线服务吞吐量提升30%,支持日均广告请求从10亿次增长到50亿次
•主导推荐算法与系统架构的深度融合,重构模型发布流水线,将算法上线周期缩短50%,显著加快业务迭代速度
•与产品、工程、质量保障等跨职能团队紧密协作,制定技术方案,攻克关键性能瓶颈,保障重大项目如期交付
•跟踪业界前沿,引入模型量化与边缘推理方案,提升团队技术视野与创新实践能力
•负责智慧零售解决方案的算法研发,完成核心推荐与搜索模块的实现与系统对接,上线后客户净推荐值达90以上
•优化训练与推理框架,通过算子融合与显存管理,将GPU资源占用降低20%,提升训练吞吐量
•设计并实现实时特征计算引擎,支持毫秒级特征生成,显著提升模型离线评估指标与在线效果
•深入理解银行客户场景,提供定制化技术方案,推动项目成功落地
•作为项目负责人,主导政务热线智能客服系统的架构设计与开发交付
•基于大规模预训练模型与多轮对话管理,构建意图理解与语义匹配组件,将槽位填充F1提升至95%
•设计基于Kubernetes的微服务架构,实现弹性扩缩容,支持百万级并发会话
•深度优化推理链路,将端到端P99延迟控制在300ms以内,显著提升市民交互体验
•系统上线后,人工坐席需求减少45%,用户首次解决率提升25%
•引入对象存储与流批一体计算引擎,支撑十亿级工业图片的实时存储与处理分析
•结合模型剪枝与TensorRT加速,在保持检测精度的同时,将推理延迟降低60%
•搭建全链路可观测性平台,实现指标、日志、链路的统一监控,保障系统99.9%可用率
•平台成功落地智能质检、生产安全等场景,创造可量化的业务收益
技术社区与开源贡献:
为某主流AI训练框架提交分布式通信优化补丁,提升 all-reduce 带宽利用率约15%,被社区合入主分支。
在ArchSummit等架构峰会发表《大规模AI推理系统的延迟优化实践》演讲,相关技术博客累计阅读量超5万,持续输出架构心得。