牛敬业
存储系统运维工程师
188****5903niu****@***.com北京30男存储系统运维工程师在职北京18k-25k •获校级二等学业奖学金,并获评“优秀课程设计”奖,课题为《基于RAFT协议的分布式元数据管理》,实现高可用命名空间。
•加入开源技术俱乐部,牵头组织“Ceph运维实战”工作坊,带领成员完成6节点集群的自动化部署与故障演练。
•参加校级IT运维技能竞赛,基于MinIO设计私有云存储接入方案,获团队二等奖,强化了存储架构设计与应急响应能力。
北京蓝海数据技术有限公司 - 平台运维中心企业数据服务混合云存储
2017.07-2020.06
存储系统运维工程师存储架构维护IO调优紧急响应
北京
•- 负责公司混合云存储环境的日常巡检与自动化运维,涵盖SAN、NAS及对象存储等多种设备,保障核心业务99.99%可用性。
•- 设计并落地多级备份策略,采用全量、增量与异地容灾相结合,月度备份数据量超80TB,通过定期演练确保恢复可靠性达100%。
•- 针对高并发读写场景,重构数据分片与缓存策略,结合NVMe磁盘柜升级,使平均I/O延迟下降35%。
•- 建立存储故障分级响应机制,编写标准化处理手册,将平均故障修复时间(MTTR)控制在1.5小时以内,年度满意度评分提升至96%。
北京云擎科技集团 - 基础平台与存储架构部云计算服务技术驱动
2020.07-2022.06
高级存储系统运维工程师分布式架构迁移智能运维知识传承
北京
•- 主导公司核心存储系统从集中式SAN向分布式全闪存架构的平滑演进,涉及在网业务数据量1.2PB,采用双写与先迁后验策略,实现业务零中断、数据零丢失。
•- 基于Prometheus与Grafana构建存储智能监控告警平台,自研数据采集器与分析规则,将告警准确率提升至92%,并实现容量趋势预测。
•- 与技术团队共建存储功能测试沙箱,针对新版本特性输出50余项改进建议,有效提升弹性卷供给与快照功能的线上稳定性。
•- 搭建内部存储运维知识库,组织专题培训20余场,覆盖存储原理、排障心法及自动化工具使用,赋能团队整体技术水平提升。
•- 项目背景:公司视频分析业务快速增长,单机存储瓶颈凸显,急需构建可横向扩展的高可用存储集群。
•- 项目内容:作为核心成员,参与Ceph集群的架构设计与部署,完成30+存储节点的安装、配置及调优;设计纠删码与多副本结合的冗余策略,平衡容量与可靠性。
•- 项目成果:上线后总存储容量达3.5PB,支撑8000+并发客户端,关键业务读写延迟下降45%,并为后续大数据分析平台提供统一存储底座。
全闪存加速与智能分层优化项目 - 高级存储系统运维工程师
2021.01-2021.06
•- 项目背景:在线交易系统对存储延迟要求苛刻,原有混合存储架构难以满足双十一峰值需求。
•- 项目内容:分析全链路IO路径,识别热点数据访问模式;引入全闪存阵列作为Tier 0缓存层,设计基于时间窗口的智能数据热度迁移策略;优化内核I/O调度算法。
•- 项目成果:峰值时段系统整体IOPS提升60%,核心交易延迟从毫秒级降至亚毫秒级,硬件采购成本节省约25%,保障了大促平稳运行。
对数据可靠性与系统持续可用有着近乎偏执的追求,享受从 IO 路径到存储池的底层排障过程;习惯用脚本消解重复劳动,注重将优化沉淀为可复用的自动化能力。性格沉稳细致,能在业务压力下保持冷静,快速判明故障边界并推进恢复。希望持续在存储运维领域深耕,用严谨与热爱守护每一笔业务数据。
存储系统运维实践:
长期维护个人Ceph与MinIO实验集群,编写自动化监控脚本,实现对OSD降级、PG受损等异常状态的主动告警与快速恢复。
在开源社区贡献Lustre性能调优文档,总结大文件顺序IO与小文件元数据瓶颈的优化策略,帮助多名用户提升集群吞吐量。
利用Prometheus+Grafana搭建存储集群可视化面板,监控IOPS、延迟及容量,并沉淀出《存储集群巡检SOP》用于日常运维。