AMAZING RESUME
牛敬业
大数据运维开发工程师
常怀探索之心,以实干沉淀自身价值
188****0523niu****@***.com北京30男大数据运维开发工程师在职北京25k-35k •完成《大数据平台运维》课程设计,基于Docker Compose搭建Hadoop+Spark集群并编写自动化部署脚本,实现一键启停与监控告警,获课程最佳实践奖。
•参与开源项目贡献,为Apache Ambari提交过两个监控插件修复,熟悉大规模集群管理工具的协作流程与代码规范。
•发起校园技术分享小组,主讲《Linux性能调优与Shell脚本实战》等主题,累计组织10余场线上线下的运维技术交流。
北京数联科技有限公司 - 数据平台运维部企业服务数据智能
2017.07-2020.06
大数据运维开发工程师平台稳定性保障性能调优运维工具开发
北京
•负责公司大数据平台线上环境的整体运维,通过建立巡检体系和故障自愈脚本,将核心集群的月度平均可用率提升至99.9%。
•主导数据仓库ETL链路的性能优化,针对Spark Shuffle环节进行参数调优与数据倾斜治理,使批处理作业的完成时间平均缩短35%。
•开发基于Python的运维工具集,实现资源水位自动采集、慢查询检测与容量预测,将日常巡检人力投入减少50%。
•协同数据开发团队搭建变更流水线,制定Review与回滚规范,保障生产环境每日数百个任务的高质量交付。
北京云擎网络科技公司 - 数据基础设施部互联网高成长企业
2020.07-2022.12
资深大数据运维开发工程师运维平台建设监控体系设计团队管理
北京
•作为技术负责人,从零搭建公司新一代云原生大数据运维中台,整合多集群管理、权限中心与审计日志模块,支撑日均PB级数据处理。
•设计并落地全链路监控告警体系,覆盖Flume、Kafka、Flink等组件,通过动态阈值与根因推荐,将平均故障发现时间从15分钟压缩至3分钟。
•重构数据分级备份与异地容灾方案,引入增量快照技术,在保证成本可控的前提下,将核心业务数据的RPO降低至分钟级。
•带领6人团队负责多个事业部数据项目的上线与运维,制定SLA标准并定期复盘,客户技术满意度连续四个季度保持在98%以上。
•针对公司交易数据仓库的Hive on Tez任务执行慢问题,系统梳理SQL逻辑与UDF开销,重写高消耗算子,使90%的报表任务提前2小时产出。
•对YARN集群调度策略进行定制化改造,引入主导资源公平队列与抢占模式,提升集群资源利用率约30%,减少排队等待。
•实施Alluxio作为数据缓存层,为Spark作业提供热数据加速,将特征工程的迭代读取速度提升60%。
•为改变多环境手动发布的混乱状况,设计并主导开发一站式运维发布平台,涵盖配置管理、灰度发布、健康检查与一键回滚。
•通过声明式编排与Ansible集成,实现大数据组件和服务器的自动化部署,将一套测试集群的搭建时间从1天缩短至40分钟。
•内置智能诊断引擎,当服务启动失败或指标异常时,自动采集栈信息并匹配已知问题库,辅助运维人员快速决策,将平均处理时长降低70%。
对数据基础设施的稳定性有一种近乎偏执的敬畏,坚信每一行脚本、每一次参数调优都关乎业务命脉。习惯用代码消灭重复劳动,享受从监控告警到自动修复全链路打磨的乐趣。具备扎实的集群治理与性能调优功底,在成本优化与灾备韧性上持续积累手感。乐于跨团队协作,希望在运维开发领域做深做透,成为让系统可依赖的那道防线。
安全运维实践:
在实验环境中搭建过基于OpenLDAP+Kerberos的认证体系,并为HDFS和Hive配置细粒度ACL,形成《大数据安全加固手册》供团队参考。
利用Python编写数据脱敏工具,支持姓名、身份证号等字段的自动识别与动态掩码,已集成到数据导出流水线中防止敏感信息泄露。