•主修课程涵盖计算机网络、操作系统、数据库原理等,曾独立用 Python 实现一个简易 TCP/IP 协议栈,加深对网络七层模型的认知。
•参加全国大学生信息安全竞赛,负责搭建攻防环境,在模拟企业内网渗透中锻炼了应急响应与安全加固思路。
•毕业设计选题为‘基于 Kubernetes 的容器化应用自动扩缩容策略’,在实验室搭建了 5 节点集群,编写了资源监控与弹性伸缩方案,积累了大规模集群管理经验。
•全面负责公司运维团队建设与战略执行,在业务高速扩张期将团队由 12 人逐步扩建至 35 人,搭建了梯队化技术培养体系,推动工程师从执行者向方案设计者转型。
•主导构建运维开发一体化平台,引入 SaltStack 完成服务器批量配置与状态管理,将新业务上线耗时从 4 天压缩至 6 小时,交付效率提升 75%。
•重构可观测性体系,采用 Prometheus + Grafana 替换老旧监控,实现业务指标、基础设施、应用链路的多维关联告警,故障平均发现时间从 25 分钟降至 5 分钟以内。
•推进容器化及云原生改造,落地 Kubernetes 集群与 Helm 标准化部署,结合 Istio 实现灰度发布,资源利用率提升 45%,年度服务器成本降低 30%。
•负责公司核心交易平台与支付链路的 7×24 高可用保障,通过压测驱动容量规划,年度服务可用性维持在 99.995%。
•参与设计同城双活与异地灾备架构,制定自动化容灾切换预案,季度演练实现业务恢复时间低于 45 分钟。
•针对 PostgreSQL 数据库进行深度优化,解决高并发下的锁竞争与索引膨胀问题,核心查询性能提升 65%。
•与基础架构团队协同,推动 CI/CD 流水线落地,支持 80 余次高频迭代安全上线,保障金融级业务稳定性。
•项目背景:公司业务呈现明显的潮汐特征,传统固定资源池难以应对突发流量,决定构建弹性伸缩的运维基座。
•项目职责:作为技术负责人,设计混合云弹性架构,引入 Kubernetes Cluster Autoscaler 与定制化调度器,实现分钟级节点扩缩。
•技术实施:搭建基于 ArgoCD 的 GitOps 交付流水线,统一管理 50+ 微服务部署,消除环境不一致导致的发布风险。
•成果量化:建成后系统在峰值时可自动扩容 3 倍,资源回收后成本下降 40%,新服务上线周期从 5 天缩短至 1.5 天。
•项目背景:为验证核心链路在极端故障下的存活能力,确保关键时刻不丢数据、不断服务。
•项目职责:主导设计混沌工程演练方案,利用 ChaosBlade 注入网络延迟、宕机等故障,检验系统韧性。
•技术实施:基于 Nginx + Keepalived 构建多活入口,引入 Redis Cluster 缓存热点数据,并针对消息队列进行削峰填谷改造。
•成果量化:演练期间系统在持续 30 分钟的高压故障注入下,业务可用性维持在 99.97%,故障自愈时间缩短至 2 分钟内。
开源与技术输出:
在 GitHub 上维护多个运维自动化工具,其中基于 Go 语言的配置中心同步工具被社区采纳超 2000 次,并收到多个企业用户的实践反馈。
持续撰写技术专栏《云原生故障诊断笔记》,围绕真实生产环境中的 Kubernetes 事故复盘,累计阅读量突破 10 万,被多家知名技术社区特邀转载。