•选修了高性能计算、网络故障诊断与自动化运维等课程,系统掌握底层系统管理与排障方法论。
•组建校内 Linux 兴趣小组,负责维护多台实验服务器,编写自动化脚本实现批量系统巡检、日志收集与备份。
•获得全国大学生服务外包创新创业大赛二等奖,主导设计基于 Prometheus 与 Grafana 的多层监控告警平台,并在校内实际部署运行。
自动化运维工程师自动化运维云平台管理容器化改造
北京
•负责集团云平台数千台服务器的自动化运维,主导编写Python与PowerShell脚本,将灾备演练环境搭建时间从3天压缩至5小时,效率提升超过90%。
•重构监控告警体系,引入夜莺与VictoriaMetrics,实现多维指标采集与智能告警收敛,大幅降低误报率,使核心业务故障发现时间缩短至分钟级。
•深度参与混合云容器化改造,基于Kubernetes与Helm,将150+个微服务平滑迁移至容器平台,通过弹性伸缩与资源超卖,整体资源利用率提升45%。
初级自动化运维工程师服务器维护脚本开发版本控制
北京
•协助运维团队完成数据中心日常巡检与故障处理,覆盖Linux系统调优、安全补丁管理及账号权限治理,保障核心业务零中断。
•独立开发日志轮转与数据备份自动化脚本,定时清理过期文件并上传至对象存储,释放存储空间约30%,减少人工操作风险。
•推动GitLab版本控制规范落地,编写CI/CD流水线模板,实现代码提交自动触发静态检查与单元测试,团队协作效率显著提升。
•该项目构建统一的研发环境自服务门户,实现资源的申请、部署、回收全生命周期管理。
•作为核心开发,设计基于Ansible与Terraform的混合编排方案,将环境交付周期从5天缩短至6小时,支持多套独立环境并行创建。
•引入资源水位监控与自动休眠策略,夜间自动回收闲置环境,资源浪费降低55%,年节省成本逾百万元。
•平台上线后,研发环境搭建工单减少90%,测试效率大幅提升,有力支撑了公司敏捷转型。
•参与重构公司核心业务系统的灾备架构,提升整体韧性。
•制定异地多活容灾策略,利用DRBD与Velero实现跨数据中心数据同步与应用状态备份。
•设计自动化混沌工程实验,定期随机注入故障进行灾备切换演练,验证RPO与RTO达标情况。
•项目完成后,经受住一次区域光纤中断考验,通过自动化流量切换5分钟内恢复服务,业务零感知。
可观测性(ELK/VictoriaMetrics)
CI/CD 与自动化发布:
深入掌握 Jenkins、GitLab CI 及 Tekton,主导设计并落地了基于 GitOps 的安全生产发布流水线,覆盖多环境一致部署。
推动 CI/CD 流水线升级,将发布周期从月级优化至每周多次,并实现一键回滚,全年无严重发布事故。