•主导搭建校内服务器集群监控与自动化部署平台,整合 Prometheus 与 Ansible,实现故障秒级告警,获校级创新项目一等奖。
•入选校 ACM 集训队并获区域赛铜牌,擅长将动态规划与图论算法应用于系统资源调度与路径优化场景。
北京云创信息技术有限公司 - 基础设施部B2B企业服务
2016.07-2019.12
•主导核心业务系统向云原生架构迁移,采用Kubernetes容器编排实现资源弹性伸缩,使服务器成本降低40%。
•设计并落地数据库读写分离方案,通过Redis集群缓存热点数据,将核心接口TP99延迟从800ms降至200ms。
•搭建Prometheus+Grafana监控体系,实现服务健康度实时可视化,故障响应时间缩短65%。
•带领5人团队完成3个SaaS平台版本迭代,建立CI/CD流水线使发版频率提升3倍。
北京智医云健康科技有限公司 - 平台架构组医疗信息化
2020.01-2022.10
•负责医疗行业核心系统高可用架构设计,通过异地多活部署保障99.99%服务可用性。
•引入GitOps工作流,将配置管理与代码库深度绑定,变更回滚效率提升80%。
•主导数据库分库分表方案设计,使用ShardingSphere处理千万级患者数据,查询性能提升50%。
•建立技术分享机制,组织每周技术沙龙,推动团队掌握Terraform自动化运维能力。
•为制造企业提供物流路径优化解决方案,通过图算法动态规划运输路线,降低运输成本25%。
•设计分布式任务调度引擎,采用Apache Kafka处理日均500万条运输数据,保障数据实时性。
•集成机器学习预测模型,结合历史订单数据优化库存配置,缺货率下降40%。
•通过Spark Streaming构建实时看板,将调度决策响应时间从小时级压缩至分钟级。
•重构音视频转码系统,采用FFmpeg分布式集群方案,支持同时处理100路4K直播流。
•实现用户画像服务微服务化,通过Apollo配置中心实现动态参数调整,AB测试效率提升3倍。
•部署Redis Cluster构建热点课程缓存池,首屏加载时间从3.2s降至0.8s。
•建立混沌工程实践体系,定期注入网络延迟故障,系统容错能力提升60%。
开源项目维护:
独立维护一套基于 Python 的数据库备份与恢复工具集,支持多引擎增量备份策略,社区下载量破 5k。
向 Apache 开源基金会提交数据库连接池优化方案,解决高并发场景下的死锁问题,被合并入主干版本。