•核心课程:深入掌握 Linux 系统管理、虚拟化与容器技术、分布式存储、持续集成与交付(CI/CD)等,独立完成基于 Prometheus + Grafana 的容器集群监控课程设计。
•荣誉奖项:连续两年荣获校级优秀学生奖学金,并获评“优秀学生干部”,带领宿舍、班级获得“学风优良集体”称号。
•竞赛实践:作为核心成员参加全国大学生服务外包创新创业大赛,基于 Kubernetes 搭建高可用微服务运维平台,实现自动扩缩容与灰度发布,获得区域赛一等奖。
容器云运维开发工程师容器编排Kubernetes自动化运维
北京
•主持公司内部PaaS平台的集群全生命周期管理,设计并落地了多区域弹性扩缩容方案,支撑日活千万级业务,全年服务可用性保持在99.95%以上。
•主导开发了容器镜像预热与缓存机制,结合P2P分发技术,将大规模容器启动耗时从分钟级压缩至秒级,整体部署效率提升50%。
•深入研发一线,搭建内部开发者门户与自助化部署流水线,将微服务上线前的环境准备时间从2天缩短至2小时,并编写标准化调试手册,降低新人上手门槛。
•构建了基于Prometheus+Alertmanager的多层级监控体系,结合自定义指标与日志联动,实现了90%的故障自愈,MTTR(平均修复时间)下降60%。
•从零搭建公司容器化基础设施,基于Kubeadm构建了高可用Kubernetes集群,纳管物理节点200+,支撑在线业务容器实例峰值超8000个。
•重构CI/CD中的镜像构建阶段,引入多阶段构建与分层缓存,使镜像构建平均耗时由8分钟降至3分钟,并推动开发团队采纳镜像瘦身规范。
•基于实际负载特征设计了混部与优先级抢占调度策略,提升集群整体CPU利用率30%,同时保障高优业务SLA不受影响。
•开发了基于Ansible的集群运维工具集,将日常扩缩容、版本升级、配置变更等操作封装为标准化Playbook,操作失误率降低90%。
企业级容器平台弹性与灰度发布系统建设 - 开发工程师
2020.01-2020.12
•作为技术骨干,主导弹性伸缩模块的设计与研发,实现基于自定义指标的HPA(水平Pod自动伸缩),精确响应业务流量波动。
•研发了基于资源画像的调度优化算法,结合历史负载数据预测,将集群资源碎片率降低15%,整体利用率提升至75%。
•设计并实现了金丝雀发布与蓝绿部署双模策略,集成至CI/CD流水线,支持流量按比例切换,发布回滚时间缩短至1分钟内,成功支撑了上百次无感上线。
•与产品、测试团队紧密协作,采用敏捷迭代方式,按时交付全部功能,并撰写了完备的运维手册与培训文档,项目获公司年度技术创新奖。
•作为项目负责人,牵头设计并开发了统一可观测性平台,整合指标、日志与链路追踪,覆盖业务、应用、容器、节点四层黄金信号。
•使用Grafana构建动态仪表盘,按租户、命名空间、服务维度展示实时健康度,并通过WebSocket推送告警,实现秒级状态刷新。
•基于Prometheus Rule与Alertmanager构建了多级告警路由,结合值班表与钉钉、邮件双通道,确保告警秒级触达,MTTD(平均检测时间)缩短70%。
•平台上线后,支撑了公司600+微服务的日常监控,在多次大促中零故障运行,并成为运维团队日常排障的核心工具,运维效率提升显著。
云原生社区贡献与实践:
作为持续交付基金会(CDF)社区成员,定期参与 Tekton 项目讨论并贡献入门指南;在公司内部推动 GitOps 工作流落地,基于 ArgoCD 实现多环境声明式部署,同时发起“运维自动化半月谈”活动,分享 Ansible 与 Terraform 实战,显著提升团队交付效能与安全水位。