188****3106niu****@***.com北京35男全栈运维总监在职北京30k-50k •作为核心成员率队参加全国大学生云计算创新大赛,基于开源组件设计智能故障自愈方案,斩获华东赛区最佳创意奖。
•为 Apache 开源项目贡献监控插件,并利用课余时间开发了校园级容器化运维管理平台,稳定支撑十余个实验室的日常研发环境。
•主导公司混合云基础设施的架构演进,制定运维标准化体系,将核心服务可用性提升至99.99%,支撑日均千万级请求。
•管理一支12人的运维团队,通过引入On-Call机制与故障演练,将平均发现时间(MTTD)缩短至5分钟,平均恢复时间(MTTR)控制在30分钟以内。
•推动Infrastructure as Code落地,使用Terraform与Ansible重构资源交付流水线,实现环境一键拉起,交付效率提升70%,变更失败率降低45%。
•协同安全与研发团队,设计并实施零信任网络架构,牵头完成全链路压测与容量规划,保障新版系统在流量峰值下零宕机上线。
•负责广告投放平台与DSP系统的线上运维,主导服务器集群的日常巡检、内核调优与自动化扩容,资源利用率提升35%。
•针对MySQL与Redis集群进行深度优化,通过慢查询治理、分库分表与读写分离,将广告检索延迟从120ms降至40ms。
•从零搭建ELK日志采集与Prometheus监控体系,设计200余项告警指标,实现故障自愈覆盖率达60%,减少夜间报警80%。
•编写并演练多套容灾预案,成功应对机房网络割接与骨干链路中断等重大故障,确保广告投放业务连续性达到99.95%。
•主导公司从单一私有云向混合云架构的迁移,设计并落地统一资源调度平台,纳管3000+物理及虚拟机。
•通过镜像标准流水线实现应用的一键发布与灰度引流,将新业务上线周期从5天压缩至半天以内。
•重构资源计费与弹性伸缩策略,引入Spot实例与节点水位管理,使基础设施成本同比下降35%。
•建立跨云统一监控与告警中枢,实现多活流量调度,平台整体可用性达到99.99%,全年仅发生一次非计划宕机。
•深度参与UGC内容分发平台的性能优化,负责CDN调度、缓存策略调整与后端服务调优。
•通过全链路追踪与火焰图分析,定位到对象存储访问延迟和序列化瓶颈,重构热点数据缓存模型。
•实施多级缓存治理、本地缓存与异步化改造,将Feed流加载时延从600ms降至180ms,系统吞吐量提升4倍。
•主导全链路压测与流量录制回放,模拟千万级DAU场景,验证优化效果,确保平台在重大活动期间无性能降级。
我深信运维是业务的数字化基石,痴迷于构建高可用、自愈型的分布式架构,并持续关注可观测性与成本优化。十余年一线实战让我练就了快速定位根因与架构决策的直觉,习惯以自动化与IaC思维消除重复劳动。善于搭建高效运维团队,以技术领导力驱动跨职能协作,打通开发、测试与发布流水线。期望在更复杂的业务场景中,用技术为系统韧性护航。
基础设施即代码(Terraform/Pulumi) 运维架构与可靠性工程:
获得 Kubernetes 管理员认证(CKA),主导设计混合云环境下的服务网格与可观测性体系,将平均故障恢复时间(MTTR)压缩至 5 分钟以内,并推动混沌工程实践常态化。