•设计并实现基于Ray框架的弹性训练调度器,解决异构算力资源争抢问题,训练任务吞吐提升58%,相关技术文档被收录于NVIDIA开发者社区
•主导搭建高校AI算力共享平台,整合300+ GPU节点资源池,开发动态资源分配策略,支撑50+科研项目并行运行
•参与国家重点研发计划'智能计算基础软件'项目,研发深度学习框架的混合精度算子库,在PaddlePaddle中集成实现
机器学习平台架构师实时计算架构算力资源编排数据治理体系
北京
•• 构建智能数据中台底座,整合Kafka+Spark Streaming实时计算链路,支撑日均500TB多模态数据处理,较传统方案降低35%存储成本
•• 设计异构计算资源调度系统,融合GPU/TPU混合算力池,使深度学习训练任务排队时长从8小时压缩至1.2小时
•• 搭建模型全生命周期管理平台,集成MLflow+DVC工具链,实现实验追踪-版本管理-一键部署闭环,模型迭代效率提升60%
•• 主导金融级数据湖建设,构建Hudi+Iceberg数据湖架构,支持毫秒级数据更新与跨域数据血缘追踪,获银保监会数据安全认证
高级算法工程师(机器学习方向)推荐系统优化特征工程平台实验效果评估
北京
•• 研发智能推荐引擎核心算法,基于图神经网络优化电商商品关联度计算,GMV转化率提升22%
•• 构建跨业务域特征存储系统,采用Redis Cluster+HBase混合架构,支撑百万QPS特征召回,延迟控制在80ms以内
•• 设计动态特征生成框架,支持业务方通过DSL自定义特征工程,特征开发周期从5天缩短至0.5天
•• 建立算法效果评估体系,构建A/B测试平台与因果推断模型,帮助业务方决策准确率提升30%
•• 构建弹性伸缩训练集群,基于Slurm+Kubernetes混合调度,支持千卡规模并行训练,故障恢复时间缩短至30秒
•• 设计梯度压缩通信协议,使大规模分布式训练通信开销降低47%,训练吞吐量提升2.3倍
•• 集成自动超参优化框架,结合NAS算法实现模型架构搜索,模型精度较人工调优提升15%
•• 建立训练任务优先级队列,支持业务方动态调整资源配额,紧急任务响应时间从2小时降至5分钟
•• 构建千亿级知识图谱存储引擎,采用Neo4j+HBase混合架构,支持亿级实体关系实时查询
•• 研发多模态意图识别模型,融合文本/语音特征,意图分类准确率达96.8%,覆盖200+业务场景
•• 设计动态知识更新机制,通过增量学习实现知识图谱每日百万级实体自动更新
•• 搭建对话策略优化系统,基于强化学习提升客服问题解决率,人工转接率下降35%
技术生态贡献:
主导Kubeflow平台国产化适配,完成对国产芯片算子的深度优化,使训练效率提升40%,技术方案获中国计算机学会推荐
创建《云原生AI开发实战》训练营,设计课程实验环境自动部署系统,累计培养3000+工程师,课程案例被阿里云采纳为官方实践范本