•作为校级开源协会的核心成员,参与维护校内公共镜像站,负责监控存储节点健康状态与日志分析,提升了故障响应与根因定位能力。
•承担公司SAN与NAS存储的日常健康检查、性能监控及故障响应,确保核心业务数据库的IO稳定。
•设计并实施多级备份策略,结合快照与异地副本,将数据恢复点目标(RPO)控制在5分钟内,关键数据丢失概率趋近于零。
•通过存储分层和数据生命周期管理,将冷数据自动迁移至低成本存储,使整体存储投入产出比提升约25%。
•协同业务研发团队,针对容器化应用定制持久化存储方案,保障微服务架构下的数据一致性。
•管理一个由5名工程师组成的存储运维小组,负责基于Ceph的分布式存储集群的日常运营与容量规划。
•深入分析存储IO路径,重构元数据缓存策略,并将数据分配算法从哈希改为动态均衡,使小文件随机读性能提升超过50%。
•基于Python与Ansible开发了存储健康自检系统,实现了故障预测、自动切流与工单联动,将人工巡检耗时减少70%。
•主导设计了同城双活+异地备份的灾备架构,并每季度组织红蓝对抗演练,确保任意单站点故障下业务分钟级恢复。
•领导一支20人的存储与备份团队,制定季度OKR与个人发展计划,建立了梯队培养机制。
•主导了公司存储架构从传统NAS向对象存储的平滑演进,部署MinIO集群取代原有方案,支撑了PB级非结构化数据的增长,同时优化了访问延迟。
•通过引入多家国产存储厂商进行POC测试,构建了多元化的供应链,在保证性能的前提下,将年度存储采购成本压缩了18%。
•牵头梳理了《存储运维基线规范》与《应急处置手册》,并通过内部Wiki与定期培训,显著降低了新人上手周期。
•作为技术骨干,深入参与容灾方案论证,负责数据同步链路的设计与压测。
•通过部署存储网关与异步复制,实现跨城市数据同步,生产实测RPO稳定在3分钟以内,RTO<20分钟。
•每季度主导灾备切换演练,编写自动化切换脚本,使得年度审计中容灾达标率100%。
•从零搭建了面向开发者的存储资源自助申请平台,通过集成审批流与配额管理,实现30分钟内交付存储卷。
•开发了基于Kubernetes CSI的存储动态供给插件,配合Prometheus监控,实现了卷的自动创建、扩容和回收,资源利用率提升至75%。
•将该平台与公司内部ITSM和CMDB系统打通,形成从预算、申请到交付、计费的完整闭环。
分布式存储与运维认证:
获得 Ceph 认证工程师 (CEE) 资格,实践了大规模分布式存储的部署、调优与故障恢复。
参加红帽存储管理专项培训,获得 RHCS 认证,掌握集群存储的架构设计与运维管理。