•连续三年获校级一等奖学金,主导设计基于Kubernetes的AI训练任务编排系统,解决GPU资源争抢问题并缩短任务排队时间55%
•参与国家重点研发计划《异构算力协同调度平台》研发,负责开发弹性伸缩中间件,支撑10万+节点集群的自动化运维
•创立校园DevOps实验室,搭建CI/CD流水线覆盖20+课程项目,推动微服务架构落地获校级教学创新奖
机器学习运维开发工程师AI基础设施运维GPU集群管理智能监控体系
北京
•负责医疗影像AI平台的7×24小时运维保障,通过优化GPU资源调度策略,使平台SLA稳定在99.95%以上
•重构模型上线流水线,引入GitOps理念实现CI/CD全自动化,模型发布周期从4小时压缩至45分钟
•设计动态资源弹性伸缩方案,结合业务波峰波谷规律,使集群成本降低30%的同时保持推理性能稳定
•搭建分布式链路追踪系统,通过日志聚类分析定位模型漂移问题,将异常发现时间缩短至15分钟内
资深机器学习运维开发工程师平台架构演进模型生命周期管理跨团队协作
北京
•主导智慧零售领域MLOps平台架构升级,支持日均千万级推荐请求,平台吞吐量提升60%
•开发模型版本热更新机制,实现A/B测试流量动态切换,实验迭代效率提高3倍
•构建全维度模型健康度看板,整合性能、成本、效果指标,为业务方提供决策依据
•带领6人团队完成3个重点项目的上线保障,客户满意度评分达4.9/5
•为某大型制造企业搭建设备故障预测AI平台,覆盖12条生产线2000+传感器节点
•设计边缘计算+云端协同架构,实现特征工程流水线自动化,模型迭代周期缩短40%
•实施模型性能衰减预警机制,通过时间序列分析提前3天识别异常模式,误报率控制在5%以内
•平台稳定运行18个月,成功预防3次重大设备故障,为客户节约停机损失超800万元
•负责数据标注平台与仿真训练系统的运维支撑,日均处理PB级路测数据
•开发分布式数据集版本管理工具,支持多版本并行实验,实验配置时间减少70%
•设计GPU资源池化方案,通过时间分片技术提升共享集群利用率至85%
•系统上线后支撑20+算法团队开发,模型迭代效率提升2.5倍
技术社区实践:
深度参与Kubernetes SIG-Node工作组,贡献3项核心PR修复Pod启动失败问题,相关代码被合并至v1.26版本
开发跨云资源监控插件k8s-xmonitor,通过Prometheus适配层实现多云环境统一观测,月活用户突破3000+
运营技术公众号『云原生实战手册』,撰写《GPU集群故障自愈最佳实践》等20+篇技术博文,累计阅读量10万+