牛敬业
188****0690niu****@***.com北京30岁男自动化运维工程师在职北京20k-30k •深入理解操作系统调度、存储管理及数据库事务、索引等机制,在课程设计中完成了一个简易的 Linux 内核模块与数据库查询优化器原型。
•参加全国大学生软件创新大赛,负责自动化部署模块,利用 Ansible 与 Shell 脚本实现多节点集群的快速搭建,获华北赛区一等奖。
•担任校开源技术协会副会长,发起“校园运维自动化”项目,带领团队开发了基于 Python 的机房巡检与告警通知系统,服务校内 200+ 台服务器。
自动化运维工程师自动化部署容器化改造监控告警体系建设
北京
•负责公司电商平台服务器集群的日常运维,编写了一套基于Ansible的自动化巡检Playbook,将全量巡检时间从每天3小时压缩至20分钟,大幅减少人工干预。
•参与自研CI/CD平台的搭建,引入Docker Swarm实现应用容器化部署,通过流水线自动构建、滚动更新,将版本发布周期从1天缩短至1小时,消除‘发布加班’痛点。
•重构了监控体系,采用Prometheus配合Alertmanager实现多维度指标采集与精准告警,搭建Grafana可视化看板,提前发现并修复了多次数据库连接池泄漏问题,保障了历次大促的平稳运行。
高级自动化运维工程师多云管理智能运维SRE团队建设
北京
•主导公司多云架构的落地,整合AWS公有云与自建私有云资源,通过统一调度平台实现资源利用率提升30%,年度IT基础设施成本降低25%。
•设计并开发了一套基于机器学习的智能告警自愈系统,利用Prometheus数据源训练故障预测模型,自动执行故障隔离与恢复,将平均修复时间从2小时缩短至15分钟。
•负责运维团队7人的技术成长,制定培训计划并定期组织源码阅读与故障复盘会,培养了3名高级工程师,带领团队顺利完成公司全年SRE指标,获得技术委员会高度认可。
•作为项目负责人,带领3人团队对电商平台老旧运维模式进行自动化改造,梳理了200+台服务器的配置基线,制定了分阶段实施方案。
•引入Ansible Tower实现集中配置管理,编写了30+个自定义模块,将应用部署、补丁更新、安全基线扫描等操作全部自动化,并建立了蓝绿部署流水线,应用发布耗时缩短70%。
•构建了基于ELK的日志集中分析平台,结合Prometheus告警,实现了从故障感知到通知的秒级响应,项目上线后平台年度故障次数下降60%,成功支撑了6次双十一大促。
基于Kubernetes的云原生运维平台建设 - 核心成员
2019.05-2020.06
•参与公司云原生运维平台的设计与开发,负责Kubernetes集群的部署与调度优化,定义了Pod优先级与资源配额策略,使集群资源利用率提升40%。
•设计并实现了CI/CD流水线,集成GitLab、Jenkins与Helm,实现代码提交后的自动构建、镜像扫描、灰度发布与回滚,将部署效率提升了一个数量级。
•制定了平台高可用方案与灾备策略,为关键业务实现了多可用区部署,模拟训练故障切换流程,最终平台全年可用性达到99.99%,支撑了公司80%的业务线容器化。
我始终认为运维是系统稳定性的守护者,对每一次报警都保持敬畏,也享受用自动化手段摆脱重复劳动、让系统优雅运行的感觉。工作中注重规范与可追溯,习惯从根源解决问题而非临时救火,面对突发故障能保持冷静快速收敛影响范围。对Linux系统有深入理解,善于运用配置管理、容器编排等技术构建可靠的基础设施,也关注可观测性建设。乐于学习前沿技术并推动落地,同时具备良好的协作意识,致力于在技术团队中发挥桥梁作用,持续提升运维效能。
基础设施即代码(Terraform、Ansible) 全链路可观测性(Grafana、Prometheus、ELK) ITIL 4 Foundation 认证:
熟练运用 ITIL 4 服务价值链,将事件、问题、变更及服务请求管理流程嵌入日常运维,成功缩短平均故障响应时间 30%。
主导优化了团队内部的知识库与变更审批看板,实现运维流程透明化,使变更失败率降低至 5% 以下,并连续两个季度达成 SLA 目标。