•在分布式系统、数据挖掘与数据仓库等核心课程中名列前茅,为数据治理技术研究打下坚实基础。
•主导实验室多源异构数据治理课题,设计质量评估模型并落地校企合作项目,解决实际数据融合难题。
•以第一作者发表SCI/EI论文2篇,并在国际数据工程会议上宣讲数据质量度量成果,展示学术影响力。
字节跳动 - 数据治理中心互联网巨头技术驱动数据密集型
2015.01-2019.12
数据治理技术专家数据治理架构团队管理数据标准建设
北京
•主导公司全域数据治理策略的制定与落地,构建涵盖数据标准、质量度量、安全分级的治理框架,推动数据质量指标提升35%以上。
•带领团队从0到1建设数据治理平台,实现元数据自动采集、血缘分析与资产目录可视化管理,使数据查找效率提升60%。
•牵头实施多个跨业务线数据治理项目,如广告投放数据治理,整合超2000万条广告数据,为算法模型提供高质量训练样本。
•与产品、运营、工程团队深度协作,输出贴合业务场景的数据治理解决方案,支撑用户增长、精细化运营等核心决策。
•持续跟踪DataOps、数据编织等行业趋势,引入数据质量实时监控与自动化治理机制,提升治理效率与数据可信度。
高级数据治理工程师数据集成ETL开发数据质量监控
北京
•深度参与数据治理项目的全生命周期,从需求分析、方案设计到实施交付,确保多个项目按时高质量上线。
•负责大规模数据清洗与ETL流程开发,处理日均TB级异构数据,保障数据准确性、完整性与时效性。
•设计并开发自动化数据质量监控平台,覆盖完整性、一致性、及时性等规则,实现异常数据秒级告警与闭环处理。
•与数据仓库团队紧密协作,优化数据分层与存储架构,提升海量数据查询性能及存储资源利用率。
•为业务部门提供敏捷数据支持,如外卖业务数据分析,辅助运营团队优化策略,显著提升订单转化率。
•项目背景:随着公司业务多元化扩张,数据孤岛严重,数据口径不一,严重影响分析效率与决策质量。
•项目目标:建设统一的数据治理平台,实现数据资产全生命周期管理与高效利用。
•- 制定企业级数据标准体系,包括元数据标准、数据安全分级、命名规范等,为数据互通奠定基础。
•- 设计灵活的规则引擎,支持自定义数据质量稽核规则,实现全链路数据质量实时监测。
•- 构建数据资产门户,提供数据目录、血缘图谱、影响分析等功能,大幅提升数据透明度和可发现性。
•- 带领团队完成历史数据清洗与迁移,处理超8000万条存量数据,确保与平台无缝对接。
•项目成果:数据质量问题下降50%,数据资产利用率提升70%,治理相关人力成本降低约30%。
•项目背景:用户行为数据分散在多个业务线,标签体系混乱,无法有效支撑精细化运营与个性化推荐。
•项目目标:整合全域用户数据,构建高质量、高可用的用户画像标签体系。
•- 深入调研业务需求,设计用户数据模型,涵盖基础属性、行为偏好、消费特征、生命周期等维度。
•- 制定数据集成方案,通过实时流与批量处理相结合,整合超2000万用户的基础与行为数据。
•- 开发用户画像标签计算框架,支持动态标签生成与周期性更新,保证标签新鲜度。
•- 建立标签质量监控与反馈闭环机制,持续提升标签准确率与覆盖率。
•项目成果:用户标签一致性提升95%,基于画像的推荐点击率提升15%,为业务带来显著的增量收益。
数据治理技术栈:
熟练集成商业与开源数据治理套件,如 Talend Data Fabric、DataHub,覆盖元数据管理、数据编排与质量监控全流程。
深度定制 Apache Atlas 与 Apache Griffin,开发自定义数据分类规则与质量告警机制,并封装为自服务治理平台组件。