•主修课程涵盖计算机网络、操作系统、数据库原理等,并主动选修了Linux系统管理与虚拟化技术,打下了坚实的技术基础。曾参加全国大学生网络技术挑战赛,通过模拟企业网故障排查与恢复,锻炼了快速定位与应急响应的能力。
•作为核心成员参与“智能运维监控”课题,利用Zabbix与Grafana搭建了可视化监控平台,实现了对服务器CPU、内存、磁盘等指标的实时采集与告警。该项目获院级创新实践优秀奖,让我对数据中心自动化运维产生了浓厚兴趣。
华云数据科技有限公司 - 运维部云数据中心服务商行业领先
2016.07-2019.12
IDC基础设施运维工程师IDC运维设备巡检快速响应
北京
•主导引入智能巡检系统,结合传感器数据采集,将传统人工巡检升级为每日两次自动巡检,故障发现时间缩短25%,并据此优化了7×24小时值班制度。
•负责服务器全生命周期操作,包括上架、下架、配置变更及固件升级,累计完成700余台设备操作,期间通过双人复核机制实现零失误。
•参与机房扩容工程,协同完成配电柜、机柜及网络线缆的安装调试,新增负载容量35%,保障了业务突增时期的资源供给。
•建立三级故障应急响应机制,定义P1/P2/P3事件处理流程,确保突发故障在20分钟内定位并启动恢复,有效维护了机房服务连续性。
北京云核数据科技有限公司 - 运维管理部大型数据中心优质服务
2020.01-2023.06
高级IDC基础设施运维工程师团队管理能效优化资产管理
北京
•带领3人运维组管理5个大型IDC机房,通过冷热通道封闭改造、精密空调群控策略优化,将年均PUE从1.65降至1.4,实现年节省电费120余万元。
•主导制定设备生命周期管理方案,建立设备健康度评分模型,依据使用年限、故障率、能耗等维度提前规划更新换代,将老旧设备导致的非计划停机风险降低40%。
•与供电、暖通及备件供应商建立长期合作,通过批量采购谈判和维保打包服务,使年度设备维修成本降低18%,备件到位时间缩短至4小时。
•定期组织技术内训和故障复盘,引入红蓝对抗演练,使团队成员独立处理配电、暖通及网络复合故障的能力平均提升25%。
•参与机房整体规划,重点负责供配电系统设计,采用2N冗余架构,并配置智能列头柜实现每路电流实时监测,确保供电可靠性。
•协调施工方、UPS厂商及综合布线团队,倒排工期,解决施工中冷通道封闭与消防管道冲突问题,保障项目如期交付。
•对机房布线、机柜安装及接地系统进行严格验收,发现并整改109处不合规项,确保所有设施符合GB 50174标准。
•机房投产后,承载2500台服务器,网络带宽升至200G,首年平均可用率达到99.99%,满足了客户对金融级基础设施的严苛要求。
•制定同城灾备总体方案,采用两地三中心架构,设计数据同步策略与自动切换流程,灾备中心选址距离主中心30公里,兼顾低延迟与物理隔离。
•搭建灾备切换演练平台,集成自动化脚本,每季度组织一次全链路切换演练,故障切换时间从45分钟缩短至15分钟。
•优化备份算法,采用增量合成备份技术,使数据备份窗口缩短50%,关键业务RTO从30分钟降至8分钟,RPO趋近于0。
•灾备中心建成后,通过等保三级测评,可在主中心发生灾难时快速接管业务,有力保障了客户的数据安全和业务连续性。
运维自动化平台实践:
自主设计并开发了基于Python的数据库备份监控系统,支持MySQL与PostgreSQL的定时全量、增量备份,并校验备份完整性。异常时自动通过邮件和钉钉推送告警,将备份失败发现时间从小时级缩短至分钟级,确保数据安全。