•作为队长参加全国大学生数学建模竞赛并获省级一等奖,在高压下快速构建模型与编写求解代码,锻炼了逻辑抽象与快速实现能力。
•课余时间参与Apache Hive社区,贡献过若干元数据同步工具的文档补丁与用例修复,养成了阅读源码和定位边界问题的习惯。
Hive运维工程师Hive集群治理灰度升级自动化运维
北京
•主导公司多套Hive集群的深度巡检与故障自愈体系建设,通过编写监控脚本与自动化处置策略,将平均故障恢复时间缩短40%。
•累计完成6次Hive大版本升级,每次均从功能兼容性、性能基准测试、数据完整性校验三个维度输出评估报告,并制定分阶段升级与逃生方案,确保业务零感知切换。
•针对复杂ETL链路的性能瓶颈,从存储格式、分区策略、CBO参数等多维度进行调优,使核心数仓任务平均执行时长下降35%。
•作为Hive平台接口人,与数据开发、分析团队建立问题响应SLA,定期组织性能优化分享,推动SQL规范落地,有效降低慢查询占比。
Hive开发工程师Hive数据建模数仓建设ETL开发
北京
•参与集团统一数据仓库的Hive侧开发与规范制定,负责数仓分层模型设计与核心表结构落地,保障数据口径一致。
•编写高可用的Hive ETL脚本,处理PB级用户行为数据,并引入数据质量监控规则,确保下游分析数据准确率达99.9%。
•与数据集成团队共建实时与离线数据通道,优化增量数据合并逻辑,将数据就绪时效从T+2提升至T+0.5。
•配合Hive集群技术演进,主导计算引擎从MR向Tez切换的适配改造,并完成集群节点扩容后的数据重分布,使集群吞吐量提升60%。
Hive多版本滚动升级与稳定性提升项目 - 项目负责人
2017 - 05-2017 - 07
•为承接公司日均新增百亿级数据存储需求,发起Hive集群从低版本到新一代架构的滚动升级。
•作为项目负责人,牵头完成版本差异分析、兼容性测试、性能压测及回滚演练,输出全套升级手册。
•设计分批次升级窗口,结合负载均衡策略将流量逐步切换至新版本节点,并定制监控大盘实时追踪任务成功率。
•升级期间主动发现并修复元数据兼容性问题2处,调优执行引擎参数,最终集群整体查询性能提升45%,无重大线上事故。
企业级用户画像数据仓库建设 - Hive开发工程师
2019 - 03-2019 - 12
•在公司级用户画像数据仓库项目中,负责Hive端数据模型设计与数据加工链路开发。
•构建星型模型,设计用户主题宽表、行为事实表及多维度标签表,确保数据可复用与口径一致。
•编写并优化复杂Hive SQL脚本,实现用户行为日志的清洗、会话切割与标签聚合,日均处理数据量超500GB。
•与业务分析团队紧密协作,将需求转化为可执行的数据指标,并推动查询模版化,降低数据获取门槛。
•通过引入ORC格式与谓词下推优化,使画像查询响应时间平均缩短50%。
Hive运维与升级实践:
深入理解Hive架构与元数据管理,独立部署过HiveServer2高可用集群,并主导过从Hive 2.3到3.1的平滑升级,涵盖元数据Schema迁移、UDF兼容性验证与回滚策略。