•在校期间,我重点攻克了 Linux 系统管理、自动化运维与数据库调优等方向课程,连续两学年获校级学业奖学金。作为校云计算兴趣小组的发起人之一,主导搭建了基于 Proxmox 的私有云实验环境,先后策划并举办了 DevOps 工具链实践工作坊、服务器故障排查挑战赛,在项目中承担架构规划与跨团队协调,逐步形成快速定位问题与推动落地的能力。
北京某云服务公司 - 运维部专精特新企业云计算服务商
2016.07-2019.12
云平台系统运维工程师云平台保障性能调优数据容灾
北京
•负责支撑日均千万级请求的云平台日常运维,通过Prometheus+Grafana构建全链路监控体系,主动发现并处理潜在隐患。
•主导对核心业务模块进行代码级性能剖析,结合缓存策略与数据库索引优化,将平均接口延迟从120ms降至80ms。
•设计并实施异地多活备份与快速恢复方案,成功在3次真实故障演练中零数据丢失恢复。
•与开发团队共建CI/CD流水线,通过灰度发布与自动化回滚机制,保障了30+次大版本迭代的平稳上线。
北京某在线教育科技公司 - 平台运维部独角兽企业在线教育平台
2020.01-2023.05
高级云平台系统运维工程师项目主导自动化建设团队提效
北京
•主导了从自建机房到公有云的全量迁移项目,协调5人团队完成200+服务的平滑迁移,业务中断时间累计不超过45分钟。
•基于Ansible与Terraform构建基础设施即代码体系,实现服务器从创建到交付的全自动化,运维人力投入减少60%。
•建立知识库与故障案例库,并推行每周技术分享会,新同事上手核心系统的时间从3周缩短至1周。
•对接云厂商技术支持,通过优化资源规格与预留实例策略,年节省云成本超百万元。
•参与电商核心系统容器化迁移项目,负责基于Kubernetes的集群规划与网络插件选型,确保服务间通信低延迟。
•制定YAML模板化部署规范,引入Helm进行应用包管理,将部署时间从小时级缩短到分钟级。
•利用Prometheus Operator监控Pod资源,通过HPA和VPA实现弹性伸缩,集群整体CPU利用率提升30%。
•与Java开发团队配合,解决日志采集与探针问题,最终将85%的非核心服务成功迁移至容器环境。
•主导在线教育混合云弹性架构项目,负责通过专线连通核心IDC与公有云,实现音视频流媒体数据的实时同步。
•设计跨云主备容灾方案,利用DNS智能解析实现流量切换,RPO低于5分钟,RTO控制在15分钟以内。
•通过分析业务波峰波谷,制定定时扩缩容与竞价实例组合策略,使云资源成本下降25%。
•带领团队完成压测与故障演练,成功支撑了百万级并发直播课,系统上线后零重大故障。
开源项目参与:
向 Zabbix 和 Grafana 社区提交过告警规则优化与仪表盘插件,累计合入 6 个 PR;同时翻译了 Terraform 部分模块文档,在论坛解答部署踩坑帖,获得社区星标认可 150+ 次。