•加入校内数据爱好者协会,牵头举办多场大数据平台运维实战工作坊,现场演示Hadoop集群的手动部署与监控面板搭建。
•毕业设计方向为《基于日志模式挖掘的数据库慢查询自愈策略》,结合时序预测与自动SQL改写,论文获评院级优秀。
大数据运维工程师平台高可用保障容量规划故障自愈开发
北京
•负责公司混合云大数据平台的日常运维,保障日均处理数百TB数据的集群7×24小时稳定运行。
•搭建多层次监控体系,覆盖存储IO、任务调度延迟、GC停顿等关键指标,主动发现并消除重复计算导致的资源浪费。
•重构数据生命周期管理策略,通过冷热分层与纠删码技术,将整体存储成本降低了20%。
•与数据开发团队协作,制定灰度发布与回滚预案,确保新特征工程链路平滑上线,不影响在跑业务。
大数据运维经理运维团队建设平台架构演进成本优化
北京
•从零组建大数据运维团队,2年内将团队从5人扩展至15人,并建立完善的on-call与排障培圳机制。
•主导编写运维白皮书,规范发布、巡检、权限管控流程,将人为失误导致的故障降低30%。
•主导大数据平台整体升级,引入Prometheus搭配自研告警收敛引擎,并推广声明式部署工具,使集群扩容效率提升60%。
•与推荐、广告等核心业务部门建立量化服务协议,根据实时流量特征动态调配计算资源,保障大促活动零降级。
•该项目旨在解决公司实时数仓在高峰期频繁出现背压和延迟毛刺的问题。
•作为项目负责人,带领团队梳理全链路拓扑,识别出5处算子倾斜和资源竞争痛点。
•引入基于消费延迟的自动弹性伸缩机制,将Flink作业的端到端延迟从平均800ms降至200ms以内。
•重构Checkpoint策略并优化状态后端,使故障恢复时间缩短50%。
•项目上线后,实时链路可用性提升至99.97%,支撑了业务方对秒级更新的强需求。
•设计基于DNS流量切换与元数据异步复制的容灾方案,拟定RPO<5分钟、RTO<30分钟的目标。
•独立搭建灾备集群并完成数据一致性校验,组织4轮全链路容灾演练,业务切流成功率100%。
•编写灾备SOP手册并进行全员培训,建立常态化抽检机制,有效消除单点风险。
•该项目为后续公司异地多活架构打下基础,获得内部技术突破奖。
运维自动化与自愈实践:
围绕大数据生态构建自动化运维体系,利用Terraform定义Hadoop/Spark集群拓扑,结合Ansible编排实现跨节点的配置同步与滚动升级;同步开发故障自愈引擎,自动关联ZooKeeper、HDFS等组件日志并执行预置修复脚本,将平均恢复时间压缩60%以上。