AMAZING RESUME / 01
NAVIGATE · EXPLORE · ADVANCE
牛敬业
Hive数据仓库运维开发
常怀探索之心,以实干沉淀自身价值
138****5678niu****@***.com北京30男Hive数据仓库运维开发在职北京20k-30k •作为核心成员参与全国大学生大数据分析与挖掘竞赛,基于Hive对校园卡流水进行多维分析,设计星型模型并完成ETL流程搭建,最终获华北赛区二等奖。
腾讯科技(深圳)有限公司 - 数据平台部互联网巨头技术驱动
2016.07-2019.12
Hive数据仓库运维开发工程师Hive运维数据仓库管理查询优化数据开发
北京
•负责腾讯Hive数据仓库的日常运维,保障离线数仓与实时数仓7×24小时稳定运行,平均每天处理20+批量数据导入任务,单日数据增量达PB级别。
•通过优化Hive SQL执行计划、增加分区策略及调整并行度,将核心报表查询响应时间从40分钟缩短至12分钟,大幅提升业务分析效率。
•与产品、运营团队紧密协作,开发数据看板与自助分析报表,每月交付30+份涵盖用户增长、留存、转化等核心指标的报告,支撑精细化运营。
•建立自动化数据备份与恢复流程,定期进行容灾演练,曾成功恢复因存储节点故障导致的数据丢失,恢复时间控制在1.5小时内,确保数据零丢失。
资深Hive数据仓库运维开发工程师Hive数仓架构升级数据治理云原生迁移
北京
•主导美团Hive数据仓库从自建Hadoop集群到云原生架构的迁移,引入Kubernetes编排,实现弹性伸缩与资源隔离,硬件成本降低20%。
•带领团队构建数据质量监控平台,配置200+条数据校验规则,实时监控数据完整性、一致性与及时性,数据异常发现时间从小时级缩短至分钟级,数据准确率提升至99.8%。
•优化数据存储格式,全面采用ORC+Snappy压缩,存储成本降低35%,同时核心查询性能提升25%。
•推动数据中台建设,统一各业务线数据模型,构建用户画像宽表,支持业务方自助分析,数据需求响应周期从3天缩短至半天。
•项目背景:随着日活增长,用户行为日志量达到每日数十亿条,原有Hive ETL任务延迟严重,无法满足实时分析需求。
•项目内容:作为核心开发,分析慢查询日志,重新设计分区策略,按日期和用户ID哈希分桶,优化大表JOIN的数据倾斜问题,将用户留存分析查询耗时从50分钟降至18分钟。
•项目成果:支撑了运营团队实时活动效果评估,活动效果评估效率提升明显,并为后续推荐系统特征工程提供了高效的取数能力。
•项目背景:公司业务线众多,数据口径不一致,需建立统一的数据仓库标准,提升数据质量与可用性。
•项目内容:负责数据清洗模块,梳理200+条业务数据清洗规则,开发ETL脚本实现数据去重、格式转换和异常值处理;设计数据质量监控体系,覆盖完整性、一致性、及时性等维度,每日自动生成数据质量报告。
•项目成果:数据质量问题发现率提升60%,为各业务线提供了高可用的基础数据,该项目获得公司年度技术创新奖。
我对数据仓库底层运维始终抱有热情,享受从慢查询与资源瓶颈中拆解问题、把系统调顺的过程。工作中偏好严谨与可复现,对数据准确性和任务稳定性近乎“洁癖”,习惯用监控与自动化取代人工兜底。深入Hive执行计划与存储格式,能从参数、倾斜、压缩等维度做精细调优,并将经验固化为工具或规范文档。乐于带小团队攻坚,也胜任技术方案沉淀,希望在一个重数据可靠性的环境里持续做深。
容器编排与云原生基础设施:
在百度智能云任职期间,主导Hive数仓的容器化改造,通过Kubernetes HPA实现Metastore与执行引擎的自动扩缩容,将高峰时段的查询延迟降低25%,并落地了基于Ceph的存算分离架构。