BUSINESS · PEOPLE · CULTURENO. 006COVER PROFILE牛敬业
云平台运维工程师
常怀探索之心,以实干沉淀自身价值
188****9521niu****@***.com北京30男云平台运维工程师在职北京20k - 25k THE NEW WORK ISSUE •系统学习TCP/IP协议栈、Linux系统管理、MySQL高可用架构等课程,扎实掌握运维核心理论。
•参与网络攻防竞赛,负责编写自动化漏洞扫描脚本,在3小时内完成对20台靶机的加固与渗透。
•毕业设计项目使用Prometheus+Grafana对接阿里云API,实现多云资源监控,降低告警延迟40%。
•负责公司混合云平台的日常巡检与故障响应,保障电商大促期间零宕机。
•通过分析历史监控数据,重新规划虚拟机亲和性规则,使数据库集群的IO等待降低22%。
•搭建内部工单知识库,将常见问题处理时长从平均40分钟压缩至15分钟,一线解决率提升至96%。
•主导季度红蓝对抗安全演练,累计发现并修复中间件配置缺陷、权限漏洞等关键风险点30余项。
高级云平台运维工程师容器化迁移运维开发容灾演练
北京
•主导核心交易系统向容器化平台的迁移,引入服务网格技术,使全链路灰度发布能力从0到1落地,应用部署密度提升40%。
•带领5人团队自研运维中台,打通CMDB、监控与工单系统,实现资源交付全流程自动化,人工干预降低35%。
•设计并演练了跨机房容灾切换方案,在真实网络分区故障中,15分钟内完成流量调度,保障了千万级用户的正常访问。
•与架构组联合优化数据库中间件配置,通过慢SQL治理和连接池调优,使核心交易接口P99延迟下降25%。
•参与将传统单体支付系统迁移至云原生架构,负责底层网络规划与存储选型。
•部署Ceph分布式存储集群,支撑数百台虚拟机的混合负载。
•重构虚拟机镜像构建流水线,通过引入Packer与Ansible,将镜像制作时间从90分钟缩短至35分钟。
•执行全链路压测,模拟每秒5000笔交易场景,验证了系统的弹性伸缩能力,瓶颈点全部提前发现并解决。
异地多活容灾体系建设项目 - 高级云平台运维工程师
2020 - 01-2020 - 06
•主导两地三中心异地多活容灾体系的建设,从方案设计到落地验收全程负责。
•设计基于消息队列的异步数据同步方案,使核心交易库的RPO趋近于0,RTO控制在5分钟以内。
•搭建真实流量的灾备演练环境,全年组织4次无通知演练,每次均在实际业务无感知的情况下完成切换。
•编写标准化容灾手册,并录制配套培训视频,为全国三个地域的30余名运维同事赋能。
对云上服务的稳定性有近乎偏执的追求,习惯从监控波动中嗅出隐患并提前加固,把每一次故障复盘都当作系统韧性的养分。信奉自动化即运维的工程信条,擅长用代码和编排工具把重复劳动打磨成可复用的自愈流程。曾带领技术小组推动运维标准化,沉淀出以文档和工具为中心的协作模式,让跨团队协同更少依赖口头沟通。期望在云基础设施领域持续深耕,用工程化手段守护业务连续性。
容器化与编排:
通过Docker Compose编排Nginx+Spring Boot+MySQL微服务栈,编写健康检查与自动重启策略,实现开发环境一键部署。