•担任《并行编程》课程助教,指导本科生完成基于CUDA的矩阵运算优化项目,带领团队斩获校级并行应用开发大赛冠军。
•主导设计并搭建实验室混合架构集群(CPU+GPU),独立研发基于Slurm的资源调度插件,实现训练任务优先级抢占与动态分配,积累全栈部署经验。
星云智算技术有限公司 - 基础架构部专精特新算力服务商
2016.07-2019.12
高性能计算集群后端开发工程师调度引擎开发资源弹性管理集群监控
北京
•主导大型仿真计算集群后端核心服务的设计与实现,重构了作业调度引擎,将平均作业等待时间缩短35%,支撑了日均百万级任务的高效流转。
•参与集群资源管理的精细化改造,引入基于历史负载预测的弹性伸缩策略,将整体资源碎片率控制在8%以内,显著降低运营成本。
•与数据中台团队共同制定API规范,设计并实现了高性能的异步通信接口,使跨服务数据交换延迟降至毫秒级。
•带领4人小组完成监控告警模块的从零搭建,覆盖集群节点、网络和存储的全链路,保障了系统可观测性和故障快速定位。
极光万象科技集团 - 高性能计算事业部中国500强技术驱动型企业
2020.01-至今
高级高性能计算集群后端开发工程师超算平台架构通信优化行业方案交付
北京
•主导公司新一代超算平台后端架构升级,采用服务网格与事件驱动相结合的设计,将系统可扩展性提升一个量级,支持跨数据中心统一调度。
•针对跨节点通信热点,重新设计序列化协议与零拷贝传输路径,使大规模并行任务的数据交换吞吐量提升45%。
•建立代码评审与静态分析流水线,制定团队编码规范与性能基准,推动代码缺陷率下降40%。
•对接金融、气象等领域的多个行业客户,深入理解其计算密集型场景,将业务需求转化为高可用的技术方案,连续三个季度获得客户书面表扬。
•该项目为国家气象局定制的新一代数值预报超算系统。负责后端作业调度和并行计算资源管理模块的开发。
•设计了基于DAG依赖解析和动态优先级的多级调度算法,实现复杂预报流程的高效编排与执行。
•开发了分布式资源状态采集器,实时汇聚上千节点的工作负载,为智能调度提供毫秒级数据支撑。
•项目上线后,区域预报模式的计算时效从2小时压缩至50分钟以内,获得客户书面致谢。
•参与某头部新能源车企的碰撞仿真计算集群建设。负责后端分布式存储与元数据检索模块开发。
•重构了仿真结果文件的索引结构,采用多级缓存与预取机制,使典型工况的检索速度提升70%。
•设计并实现了基于纠删码的跨节点数据容错方案,确保在部分节点故障时仿真数据不丢失。
•项目支撑了每日超过2000次整车碰撞仿真任务,稳定运行至今,成为该车企研发核心基础设施。
分布式协调与集群管理:
深入理解Paxos/Raft共识算法与数据分片机制,在开源项目基础上二次开发,构建轻量级分布式锁服务,用于集群主节点选举与故障切换,具备高可用分布式系统设计能力。