AMAZING RESUME / 01
BURN BRIGHT · MOVE FORWARD
牛敬业
大数据系统运维工程师
常怀探索之心,以实干沉淀自身价值
188****3734niu****@***.com北京30男大数据系统运维工程师在职北京20k-30k •在校期间深入研究了分布式存储、流式计算与Linux内核调优等课程,作为核心成员参与全国高校大数据应用创新大赛,主导搭建高可用Hadoop生态集群,通过参数调优与故障演练,将数据清洗吞吐量提升40%,并输出自动化运维脚本。
•加入校园运维兴趣小组,利用Prometheus、Grafana和ELK体系为实验室服务器构建监控与日志分析平台,实现异常秒级告警,并考取RHCE认证,强化了大规模集群的实战排障与自动化管理能力。
大数据系统运维工程师数据中台运维资源调度优化容灾体系建设
北京
•负责公司数据中台全链路的运维保障,支撑实时计算、批量处理等混部集群7×24小时高可用。通过重构YARN资源调度策略与实施存储分层,集群整体资源利用率提升45%,年节省硬件采购与托管成本超80万元。
•主导灾备与恢复体系优化,建立多级数据快照与异地实时同步机制,并将恢复流程编排为自动化演练。历史上多次应对硬件级故障,核心业务数据集恢复时间从原先的3小时压缩至40分钟以内。
•协同数据开发与算法团队推进模型迭代上线,制定灰度发布及回滚标准。主导完成6次大版本架构升级,全部实现业务零感知切换,并输出标准化部署手册。
北京深算互娱科技有限公司 - 基础架构与运维部高速成长企业
2019.01-2022.05
高级大数据系统运维工程师运维团队管理可观测性建设数据架构设计
北京
•带领8人运维团队负责公司核心实时与离线数据平台的全面管理,制定团队OKR与值班规范。引入Prometheus+Grafana+自研Exporter体系,将日常巡检、扩缩容等操作自动化率提升至70%,团队人力投入减少30%。
•设计并落地全栈可观测性方案,覆盖基础设施、中间件及业务指标,建立告警收敛与根因分析流程。累计提前识别并消除20余次潜在风险,避免因数据同步延迟与资源争抢导致的业务中断。
•深度参与公司同城双活数据中心的规划与落地,负责数据层架构选型及迁移方案评审。主导跨机房近实时同步切换演练,最终实现核心链路的双活改造,业务中断窗口控制在秒级。
•项目背景:公司广告业务线数据量激增,现有Flink集群出现严重背压,导致报表延迟超过2小时,影响实时竞价决策。
•项目内容:作为核心推进者,主导计算链路瓶颈分析,重写部分算子序列化逻辑,优化RocksDB状态后端及Checkpoint策略,并调整Kafka分区与并行度。
•项目成果:端到端延迟从90分钟降至5分钟以内,系统吞吐量提升3倍,顺利扛住双十一期间日均50亿条事件的冲击,上线后零故障。
•项目背景:公司新开拓金融风控SaaS业务,需从零构建一套满足合规审计要求的数据治理与运维平台。
•项目内容:全面负责高可用部署方案设计,设计跨VPC网络互通与安全隔离策略,制定数据分级加密与脱敏规范。主导元数据采集与数据血缘追踪系统的搭建,并实现全链路告警。
•项目成果:平台按期上线,首月即接入3家银行客户,管理数据量超20TB,系统可用性保持99.99%,获得客户技术验收高度认可。
对数据系统的稳定与高效运行有天然的执着,享受从日志和监控中捕捉征兆、提前化解风险的成就感。做事严谨、沉着,面对突发故障能快速定位并推动恢复,有较强的抗压和复盘闭环意识。技术栈紧跟大数据生态,擅长用自动化手段治理集群、优化性能,降低运维成本。乐于跨团队协作,习惯用可落地的方案而非单向要求来推动问题解决,希望持续在运维一线深耕,守护业务生命线。
分布式数据库运维(HBase/ClickHouse)
自动化运维实践:
主导个人服务器集群建设,基于Docker-Compose部署MySQL主从、ClickHouse与Redis集群,编写Ansible剧本实现一键环境初始化,并利用Prometheus+Alertmanager搭建全链路监控,持续运行超过500天,累计处理TB级运维日志。