•系统修读了数据库原理、分布式系统、计算机网络等课程,核心专业课均分87分,曾获校级优秀学业奖学金,善于将理论融入运维场景的排查与优化。
•曾参与全国服务外包创新大赛,主导搭建了一套基于容器化的配置管理原型,设计数据库分库分表方案并实现配置发布流水线,项目获区域赛二等奖,培养了端到端的运维交付思维。
云帆数智科技有限公司 - 运维部互联网企业高新技术企业
2014.07-2017.12
配置管理系统运维工程师配置平台运维变更管理故障排查
北京
•负责公司核心配置管理平台的日常运维,覆盖200+台服务器节点,通过定制化监控与自愈脚本,将季度内非计划停机时间压缩至45分钟以内,系统可用性稳定在99.95%以上。
•重构配置下发流水线,将原先需要人工逐台操作的参数变更,改为基于模板的批量推送与灰度验证,处理周期从平均3小时缩短至45分钟,变更成功率提升至98%。
•作为运维侧的接口人,与Java开发团队共同排查配置中心与微服务兼容性问题,累计解决深层次配置冲突与版本回退故障12起,并沉淀了《配置冲突排查手册》。
•主导编写了覆盖安装部署、故障切换、备份恢复等场景的运维自动化剧本,并面向新入职员工和初级运维开展5场专题培训,累计培训28人次,显著降低了新人上手时长。
星辰运维科技有限公司 - 运维技术部行业领先创新型企业
2018.01-2021.06
高级配置管理系统运维工程师项目交付IaC自动化可观测性建设
北京
•主导公司配置管理系统从单体架构向高可用集群的迁移项目,带领5人小组制定详细的迁移方案与回滚预案,在3个月内完成全量业务平滑切换,期间零重大配置事故。
•引入基础设施即代码(IaC)理念,使用Terraform结合Ansible进行配置项的声明式管理,将服务器配置合规性检查的人工作业量减少80%,每年相当于释放了2名全职人力。
•搭建了基于Prometheus与Grafana的配置服务监控看板,并设置了请求延迟、配置加载失败率等关键指标,通过提前预警,成功拦截了4次因证书过期或依赖包版本冲突可能引发的区域级服务宕机。
•与安全、合规、开发等6个部门共同制定《跨部门配置管理规范》,定义了配置项命名空间、生命周期和审计策略,推动全公司12个业务线统一采用该规范,显著降低了配置碎片化。
•参与公司内部配置中心深度优化,作为性能调优核心成员,负责分析海量日志与慢查询。通过全链路压测,精准定位到线程池配置不合理及数据库连接池泄露等3个关键瓶颈。
•对MySQL数据库进行参数优化和索引重建,将配置拉取接口的P99延迟从2.5秒降至350毫秒,支撑了早晚高峰时段的流量洪峰。
•设计并实现了一套配置变更影响沙盒,能在变更前模拟其对下游100+服务的影响范围,快速识别潜在风险,上线后因配置变更引发的故障数量同比下降65%。
•主导公司新电商业务线配置管理平台从0到1的建设。从立项调研、技术选型到系统上线全程负责,搭建的平台完美适配了秒杀、大促等场景下配置的动态下发需求。
•设计多活架构,采用异地容灾与配置实时同步方案,确保在大促期间系统稳定承载了15万+的并发配置查询请求。
•建立了配置变更的完整审计链,记录了每一次修改的操作人、时间、内容和审批流,满足了ISO 27001信息安全认证要求,顺利通过年度外审。
配置管理工具链(Apollo/Nacos/ACM) ITIL服务管理认证:
已取得ITIL 4 Foundation认证,能熟练运用服务价值链、持续改进等实践,将ITIL理念融入日常的变更管理、事件响应与配置审计工作,驱动运维服务标准化与质量提升。
技术社区共建:
作为某开源配置中心项目的社区贡献者,曾提交过集群配置同步性能优化与并发控制修复的补丁,并开发了基于Prometheus的配置变更监控Exporter,累计有6个PR被合并,持续提升工具的可观测性与稳定性。