•核心课程成绩优异,包括分布式系统、数据库内核原理、数据挖掘导论等,课程设计中使用MapReduce编写了海量日志去重与分析程序,在单机伪分布式环境下完成数据清洗全流程。
•参加全国大学生数学建模竞赛,负责大数据题目的数据预处理与特征工程,利用Python与Spark完成了千万级用户行为数据的聚合与异常检测,获得省级一等奖。
•主导校园一卡通数据分析项目,设计Hive数据仓库分层模型,开发ETL脚本清洗、整合刷卡与消费数据,构建用户画像基础宽表,供后续消费行为分析使用。
•毕业设计《基于Hadoop的电商用户行为数据治理平台》独立搭建5节点集群,实现埋点日志采集、Flume-Kafka-HDFS管道、数据质量校验及报表展示,获评优秀并作为校级优秀实践案例。
Hadoop数据治理工程师Hadoop数据治理数据质量
北京
•主导阿里巴巴电商主数据域的治理工作,设计数据质量度量模型,建立覆盖完整性、一致性、时效性的量化评估体系。
•重构离线数据清洗链路,引入Spark与Flink混合计算框架,将日增百亿级数据的ETL延迟从小时级压缩至分钟级。
•深入商品、交易、物流等业务场景,与运营团队协同制定数据标准,输出数据字典及元数据管理规范,解决长期存在的口径不一致问题。
•搭建Hadoop集群健康度看板,开发自动化巡检脚本,实现小文件合并、数据倾斜检测等问题的主动预警与自愈。
•组织内部数据治理培训,撰写《数据研发规范》与《数据问题排查手册》,推动团队从依赖人工排查向平台化治理转型。
Hadoop数据治理工程师Hadoop数据架构性能优化
北京
•带领腾讯游戏数据治理项目组,完成全域数据资产盘点,梳理数万张表的血缘关系,构建数据地图与资产目录。
•优化Hive/Spark任务调度与存储策略,通过冷热分层、压缩算法升级,将存储成本降低40%,关键报表计算时间缩短35%。
•设计数据质量监控平台,集成规则引擎与异常检测算法,实现数据接入、加工、产出全链路的实时质量评分与告警。
•联合安全与合规团队,制定数据分级分类标准,落地敏感字段脱敏、访问权限管控等策略,确保用户隐私数据零泄露。
•推广DataOps理念,将数据标准、质量检查嵌入开发上线流程,推动13个业务线实现数据治理的自动化卡点,治理效率提升60%。
•项目目标是对阿里巴巴电商生态的海量用户行为数据进行标准化治理,产出高质量的用户标签,支撑个性化推荐与营销。
•负责搭建高可用Hadoop集群,优化YARN资源调度策略,确保集群在大促峰值期间稳定运行。
•设计并实现多源数据清洗流程,通过正则、字典映射、异常值剔除等手段,将用户ID、行为路线的脏数据率从8%降至0.5%以下。
•采用星型模型构建数据仓库分层,将ODS、DWD、DWS层边界清晰化,并统一数据口径。
•开发自动化数据质量报告与可视化看板,向产品、运营团队交付每日数据健康度,推动数据驱动决策。
•治理后,画像标签的准确率提升至99.2%,下游推荐系统点击率提升18%,数据存储成本降低25%。
•项目旨在整合腾讯旗下多款游戏的数据,打通账号、支付、行为等主题域,构建统一的数据中台。
•参与数据集成方案设计,确定基于Kafka+Spark Streaming的实时抽取与Hive离线批量加载的混合模式。
•利用Hive、Spark SQL进行大规模数据关联与转换,完成200+数据源的接入与标准化。
•建立数据字典与血缘关系,制定元数据管理规范,确保所有数据变更可追溯、可审计。
•实施数据质量稽核体系,通过预置规则与动态阈值持续监控,发现并修复数据延迟、缺失、重复等关键问题。
•项目上线后,跨游戏数据查询效率提升50%,数据共享率从30%跃升至90%,有力支撑了用户流失预测、付费分析等上层应用。
数据治理与模型设计:
深入理解数据治理框架,曾参照DAMA体系设计数据标准管理模块,为业务系统定义数据元与编码规范,推动主数据一致性与跨系统共享。
擅长维度建模与数据湖架构,实践中根据供应链场景构建雪花模型并制定数据分层策略,在ADS层通过物化视图与汇总表加速报表查询,同时建立数据血缘追踪与质量监控脚本,将核心表数据准确率提升至99.9%。