•系统学习 Linux 内核原理、容器化技术与云原生架构,掌握自动化运维与持续交付的工程基础。
•加入校内运维兴趣小组,主导搭建基于 Kubernetes 的实验室集群,并编写运维脚本实现集群监控与日志收集。
•作为队长率队参加全国大学生 IT 运维技能竞赛,设计并实现跨云资源调度方案,获得华北区一等奖,工程落地与协同能力显著提升。
北京智云科技有限公司 - 运维部专精特新企业云原生实践者
2018.07-2021.12
容器云运维工程师容器平台运维监控与资源优化故障预案
北京
•负责公司混合云容器平台的日常运行保障,维护多套Kubernetes集群的稳定与安全。
•通过Prometheus与Grafana构建全链路监控体系,结合资源预测动态调整节点配额,使集群资源碎片率下降18%。
•主导故障响应流程优化,通过编写故障自愈脚本与完善On-Call手册,将重大故障平均恢复时间压缩至25分钟以内。
•协同研发团队推动微服务容器化改造,累计完成在线教育、金融科技等业务线60余个服务的标准化上云。
•设计并落地了集群级别的多地域备份与灾备演练方案,保障核心业务数据RPO<1分钟。
北京极光网络技术有限公司 - 运维部互联网大厂技术驱动型企业
2022.01-至今
高级容器云运维工程师平台架构设计容量与成本优化技术团队培养
北京
•主导企业级容器云平台从0到1的架构设计,选型containerd与云原生网络方案,输出技术白皮书与实施路线图。
•搭建大规模压测环境,针对API网关与调度器进行深度调优,使平台在电商大促期间承载并发请求量提升40%。
•建立运维培训体系,通过实战演练与代码审查,培养出4名具备独立处理线上问题的容器运维工程师。
•重构CI/CD流水线,将GitOps与Argo CD结合,实现应用部署从代码提交到上线全自动化,平均部署耗时缩短至20分钟。
•与云厂商架构师合作,引入竞价实例与弹性伸缩策略,在保稳定的前提下将基础资源成本降低22%。
•牵头将公司自建容器平台迁移至混合云架构,实现不同云厂商容器服务的统一接入。
•制定分阶段迁移方案,涵盖镜像仓库同步、服务流量切换、配置中心适配等关键环节。
•组织研发、测试、安全团队进行三轮混沌工程演练,验证网络分区与节点故障下的自动恢复能力。
•迁移期间值守监控大盘,实时调整灰度策略,确保近200个服务无感知平滑切换。
•迁移完成后对手动操作进行代码化沉淀,平台整体可用性提升至99.95%,跨云管理效率提升60%。
•参与开发面向容器云平台的智能运维机器人,用于自动巡检、风险预警与故障自愈。
•梳理高频运维场景,设计巡检规则引擎与异常检测模型,覆盖磁盘、内存、Pod状态等20余项指标。
•与后端工程师协作,实现基于Webhook的自动化处置动作,包括重启异常Pod、清理僵尸容器与扩容节点。
•机器人上线后,日常巡检人工投入降低70%,重复性告警误报率下降45%。
•持续进行功能迭代,增加自然语言交互查询集群状态的能力,降低运维信息获取门槛。
云原生运维实战:
掌握 Kubernetes 集群管理及 Helm 编排,熟悉 CoreDNS、Calico 等网络插件配置,有实际集群升级与故障排查经验。
主导过运维监控体系搭建,利用 Prometheus + Grafana 完成指标采集与看板建设,并编写告警规则实现自动化响应。
基于 Ansible 开发一键部署与巡检剧本,实现批量服务器配置与合规检查,减少人工操作失误,提升运维效率。