•曾组队参与蓝桥杯全国软件和信息技术专业人才大赛,负责后端服务与数据库优化,获得省级二等奖,强化了故障排查与性能调优能力。
北京快手科技有限公司 - 基础架构部头部互联网技术驱动
2015.07-2019.12
•负责公司在线业务服务器集群的日常健康检查、系统补丁管理与安全加固,建立了一套基于 Zabbix 的全链路监控体系,提前预警多次潜在故障。
•通过分析业务峰值规律,动态调整了服务器资源分配策略,使内存使用率峰值从 85% 降至 65% 以下,显著降低了资源争抢。
•主导了核心数据库服务器的异地容灾方案实施,成功演练了三次数据恢复,确保 RPO 小于 5 分钟,挽回潜在经济损失逾百万元。
•与 SRE 团队协作,优化了 CI/CD 流水线中的部署环节,将应用发布停机时间缩短至零,保障了亿级用户产品的 99.99% 可用性。
北京滴滴出行科技有限公司 - 云计算基础架构部互联网巨头技术领先
2020.01-至今
高级服务器运维工程师自动化运维故障管理技术培训
北京
•领导了公司新一代绿色数据中心服务器的标准化部署,采用了自动化装机工具 Cobbler,两周内完成 300 台服务器的上线,比计划提前 20 天。
•推行了基于 Terraform 和 Ansible 的 IaC 管理,将环境配置一致性提升至 100%,运维人力成本降低 40%。
•构建了故障自愈流程,结合 Prometheus 和 Alertmanager,实现了 80% 常规告警的自动处理,MTTR 从 2.5 小时降至 30 分钟。
•组织每周技术分享会,引导团队掌握 eBPF 等内核观测技术,团队整体技能评级上升 2 级,并荣获公司年度“金牌运维团队”称号。
在线教育平台服务器集群扩容项目 - 服务器运维负责人
2017.06-2017.10
•参与企业内部教学服务平台服务器集群扩容项目,研判用户访问量增速,输出资源扩展计划。
•统筹新主机的选型、部署、操作系统初始化与参数调优,累计完成120台物理节点上线。
•重构网络拓扑,引入反向代理与流量分发机制,增强系统并发承载力,使平台在寒暑假期大促阶段的吞吐量提升35%。
•实时巡检主机健康度,快速解决扩展期间的网络抖动、存储吞吐瓶颈等异常,确保平台平稳运行。
•主导金融业务系统混合云架构服务器迁移项目,分析主机资源利用率和数据规模,设计迁移路线。
•开发批处理迁移工具,实现操作系统与业务数据的批量无缝割接,共完成80台物理机迁移。
•验证异构环境下的适配性与运行效率,调整内核参数、中间件配置,使服务器在混合云场景的延迟降低20%。
•建设告警与运维流程,保障业务连续性,实现项目期间业务中断时间(RTO)小于1小时。
基础设施自动化:
主导过 Prometheus + Grafana 监控体系搭建,实现服务器指标实时告警。熟练使用 SaltStack 管理数千节点,推进配置标准化,显著降低人为误操作风险。