•作为核心成员参加全国大学生信息安全竞赛,在区域赛中负责流量侧分析与入侵检测,帮助队伍获得二等奖。
•牵头开发校园综合服务小程序,独立搭建CI/CD流水线与自动化健康检查,支撑日活5000+,积累全栈发布与应急响应经验。
互联网运维总监运维架构设计分布式系统运维运维自动化
北京
•主导公司社交与游戏业务线的运维体系建设,制定多活容灾策略,确保亿级用户场景下的系统高可用。
•负责30人运维团队的全生命周期管理,推行OKR与技能矩阵,提升团队在云原生方向的攻坚能力。
•深度参与核心业务架构评审,推动微服务拆分与容器化改造,降低系统耦合度,提升部署效率。
•搭建全链路监控与智能告警平台,实现故障1分钟内发现、5分钟内定位,全年核心服务可用性达99.99%。
•引入ChatOps与自动化运维工具体系,将变更操作自动化率从30%提升至85%,显著降低人为失误。
•参与美团外卖核心交易系统的日常运维,负责高峰期流量调度与突发故障处理,保障订单链路稳定。
•协同研发团队制定灰度发布与滚动升级策略,主导完成20余次大版本平滑上线,无重大回滚事故。
•针对服务器资源成本高的问题,推行混合云弹性伸缩方案,优化资源利用率,年度节省成本超千万。
•编写标准化运维手册与故障演练脚本,组织跨部门红蓝对抗,提升整体应急响应能力。
•快速响应业务部门数据查询与性能分析需求,开发自动化报表工具,服务满意度评分持续领先。
•为应对社交业务爆发式增长,启动核心系统架构升级,我作为项目负责人主导整体方案设计。
•重新设计系统架构,从单体应用拆分为50+微服务,引入Service Mesh技术治理服务间通信,提升系统可扩展性。
•数据库层面实施分库分表与读写分离,并迁移至分布式数据库TDSQL,QPS提升10倍。
•搭建持续交付流水线,实现代码提交到生产部署全自动化,上线频率从月级提升至周级。
•项目完成后,系统平均响应时间从200ms降至50ms,并发能力提升8倍,支撑了次年春晚红包活动零故障。
•针对运维效率瓶颈,我发起智能运维平台项目,负责需求分析与架构设计,确定以数据湖+机器学习为核心的技术路线。
•带领跨部门团队开发异常检测、根因分析、自动扩容等模块,集成Prometheus、Grafana等工具。
•平台实现服务器自动装机、配置基线管理、故障自愈,覆盖公司90%以上业务线。
•上线后,平均故障修复时间(MTTR)缩短70%,运维人力投入减少40%,获公司年度技术创新奖。
云原生运维生态:
深耕容器化与微服务治理,主导过千级节点Kubernetes集群的版本升级与故障演练,沉淀出集群自愈手册。
将混沌工程引入混合云环境,设计全链路压测方案,提升系统韧性,保障核心业务SLA达99.99%。