AMAZING RESUME
牛敬业
188****9775niu****@***.com北京30男Hive运维工程师在职北京20k-25k •核心课程:分布式存储与计算、数据库原理、编译原理,深入理解MapReduce与SQL解析过程
•实践项目:主导设计基于Hive on Spark的离线数据仓库,接入500GB模拟日志,完成ETL与分区优化,查询性能提升40%
•竞赛经历:担任队长参加全国高校大数据挑战赛,负责Hive脚本调优与集群任务调度,获华北赛区一等奖
Hive运维工程师Hive集群治理数仓分层建设SQL调优培训
北京
•- 负责公司核心Hive on Spark集群的日常保障,涵盖7×24小时监控告警、资源队列梳理与异常作业干预。通过重写部分ETL任务中的JOIN策略并启用向量化执行,将日度报表作业的平均耗时压降了35%。
•- 深入参与用户行为数据仓库的分层建设,主导DWD层数仓模型评审与Hive表结构设计,处理日均增量数据超800GB。沉淀了一套面向分析师的自助查询优化手册,减少了约40%的重复性低效SQL提交。
•- 与数据架构组协作,面向新入职数据工程师开展Hive实战培训,编写了《Hive作业避坑指南》内部文档,并组织季度性能调优案例复盘,累计覆盖70余人次。
Hive运维工程师Hive版本演进数据安全治理可观测性建设
北京
•- 主导公司Hive集群从CDH 5.x到CDP 7.x的平滑升级,编写自动化迁移脚本并完成全量历史元数据校验,确保金融级风控业务无中断。迁移期间重构了数据生命周期策略,将冷数据自动转储至对象存储,节省约28%的存储开销。
•- 设计并落地Hive数据安全框架,融合Ranger策略与KMS加密,实现了表级、列级、行级过滤的权限管控体系。通过审计日志分析,主动识别并修复了3个潜在的数据越权访问风险点。
•- 搭建基于Prometheus+Grafana+自研Exporter的Hive多维监控体系,覆盖HS2会话数、Tez Container OOM次数、HDFS小文件占比等20余项核心指标,并配置了规则引擎自动触发扩容或重跑,将集群非计划性停机时间降低了70%。
广告DMP实时数仓Hive底座优化 - 项目负责人
2019.05-2019.12
•- 项目背景:广告业务线引入实时流处理后,离线Hive底座出现严重的元数据膨胀与凌晨批次延迟,导致人群包计算超时,影响广告投放。
•- 项目目标:在不增加硬件成本的前提下,将Hive底座的凌晨ETL SLA达成率从92%提升至99.5%以上。
•- 项目成果:通过分析Flink Hive Streaming Writer的小文件产生规律,引入Iceberg表格式并配合Hive Compaction任务编排,将Hive侧小文件数降低了85%。同时优化了分区裁剪逻辑,使人群包关联查询的平均执行时间从45分钟降至12分钟,稳定支撑了日均百亿级广告曝光的数据回溯。
企业经营数据中台ODS层构建 - Hive技术负责人
2021.03-2021.12
•- 项目背景:公司启动财务、供应链数据中台项目,需要将ERP、CRM等异构数据源统一入湖,并构建可复用的操作数据层。
•- 项目目标:基于Hive构建高一致性的ODS层,实现全量与增量数据的自动化接入及数据质量稽核。
•- 项目成果:设计并实现了基于DataX与Sqoop的混合抽取框架,并利用Hive Merge语句处理CDC变更数据。构建了30+张核心ODS表,并建立了基于Great Expectations的数据质量监控规则集,使下游数据质量问题报修量下降了60%,为财务报告与供应链优化提供了可信的单一事实来源。
对数据底层稳定性与查询效率有天然执着,享受从慢SQL、资源争用中定位根因并推动治理闭环。习惯严谨且克制的变更习惯,关注集群容量规划、权限收敛与元数据管理,不制造隐患。善于用脚本化、文档化思路沉淀排障与优化方案,让协作更轻量。希望在一个重视数据可靠性的团队里,持续深耕Hive生态,成为让业务方放心的底座守护者。
自动化运维与脚本开发:
熟练编写Shell与Python自动化脚本,曾为Hive集群开发一套日志清理与元数据备份工具,日均处理10万条日志,减少人工干预70%
针对HiveServer2频繁Full GC问题,定制JVM参数(-XX:+UseG1GC, -XX:MaxGCPauseMillis=200)并监控结果,使查询超时率下降30%