•参与国家级大学生创新创业训练计划“基于Hive的电影推荐系统离线数据分析”,主导数据清洗、分区表设计与HiveQL聚合查询,实现TB级用户行为日志的批处理,洞察用户偏好规律。
•毕业设计课题为“Hive查询性能调优与ORC文件存储策略研究”,基于TPC-DS基准测试对Hive on Tez引擎进行参数优化与压缩格式对比,使复杂查询响应时间降低40%,形成完整的数据仓库性能调优方法论。
北京橙云数据科技有限公司 - 数据平台部企业级数据服务
2016.07-2019.06
Hive数据管理专员Hive运维数据仓库管理ETL开发数据质量保障
北京
•负责公司核心Hive数据仓库的日常运维,主导金融信贷业务数据的接入、清洗与标准化转换,将多源异构数据整合为统一格式。
•针对慢查询进行专项优化,通过重写SQL逻辑、调整MapReduce参数,将核心报表的平均响应时间从40秒压缩至20秒以内。
•与风控、运营部门紧密协作,根据业务变化快速设计并交付用户行为漏斗、资产质量监控等分析报表,支撑贷前贷后决策。
•搭建Hive数据的定期备份与异地恢复演练机制,并制定数据安全规范,确保数据零丢失、高可用。
北京星云大数据技术有限公司 - 大数据研发中心智能决策与大数据
2019.07-2022.06
Hive数据管理专员Hive架构设计数据倾斜治理自动化脚本技术分享
北京
•深度参与公司实时大数据平台升级,独立负责Hive模块的架构设计,采用分层数仓与动态分区方案,使数据接入灵活性提升一倍。
•处理TB级日志数据中的严重数据倾斜,通过加盐、二次聚合等策略,将计算任务耗时从小时级降至分钟级,极大释放集群资源。
•编写Hive自动化脚本,实现每日增量数据的自动采集、清洗与入库,替代原有手工干预,效率提升70%以上。
•组织内部Hive技术沙龙,编写《Hive调优实战手册》,为团队沉淀了23个常见问题处理方案,显著降低新人上手门槛。
某连锁零售企业全渠道数据仓库建设项目 - 数据管理专员
2017.03-2017.09
•为一家拥有200+门店的连锁零售企业搭建Hive数据仓库,整合ERP、POS、电商平台等渠道数据,实现会员、库存、销售的统一分析。
•主导数据模型设计,采用雪花模型构建维度表与事实表,并针对高频查询字段设计宽表,显著降低跨表关联复杂度。
•开发完整的Hive ETL流程,利用Sqoop将关系型数据导入Hive,通过脚本完成数据清洗、去重和拉链表生成,保障数据一致性。
•优化商品关联分析、会员生命周期等复杂SQL,使此前跑不出来的指标在5分钟内可出结果。
•项目上线后,企业库存周转率提升15%,会员复购率提升8%,获得客户书面表扬。
内部风控数据平台Hive深度优化项目 - 数据管理专员
2020.01-2020.06
•参与公司风控数据平台升级,重点解决Hive在高并发查询下的性能瓶颈,确保实时风控决策毫秒级响应。
•重新设计分区键,将按日分区改为按业务类型+日期二级分区,并采用ORC+Snappy压缩,单表查询效率提升40%以上。
•为满足特征工程需求,开发了3个自定义Hive UDF,包括设备指纹解析、IP归属地查询等,将原本需要外部程序处理的任务下沉到SQL完成。
•输出《Hive性能优化指南》并录制操作视频,帮助跨部门同事快速上手,平台整体查询失败率由12%降至0.5%以下。
Linux运维与自动化开发:
精通Linux系统管理,能独立编写Shell及Python脚本实现数据管道监控、日志轮转与磁盘空间预警,保障HiveServer2与Metastore服务的高可用运行。
具备Hive在云原生与物理集群环境下的部署与故障排查经验,擅长分析Hive作业执行计划、解决数据倾斜与GC停顿问题,通过调整内存与并发参数优化吞吐量。