AMAZING RESUME · EXECUTIVE PROFILE
牛敬业
数据仓库数据治理工程师
188****8100niu****@***.com北京30男数据仓库数据治理工程师在职北京25k-35k •主导数据库课程设计,构建校园数据仓库原型,设计ETL流水线清洗并整合多源异构数据,实现数据资产统一视图。
•参加全国大学生数学建模竞赛,负责大规模数据的预处理与特征工程,获省级二等奖,强化了数据质量控制与建模思维。
北京融信数据科技有限公司 - 数据资产部高新技术企业行业领先
2016.01-2019.12
数据仓库数据治理工程师数据标准数据质量数据架构
北京
•主导企业级数据治理框架的搭建,编制并推行数据生命周期管理规范,覆盖主数据、交易数据与指标数据,确保数据一致性与可用性。
•重构数据仓库分层模型,引入数据湖混合架构,实施冷热数据分离策略,将核心报表查询效率提升60%,存储成本降低25%。
•构建自动化数据质量稽核平台,部署超过500条业务规则,实现异常数据分钟级告警,并通过工单闭环驱动修复。
•深入业务线梳理数据需求,设计自助式数据服务接口,降低数据获取门槛,使业务部门自助取数覆盖率提升至70%。
•作为导师培养3名数据治理专员,建立内部知识库与标准作业程序,显著提升团队的数据把控能力。
北京智联数科信息技术有限公司 - 数据中台部互联网大厂创新型企业
2020.01-至今
数据仓库数据治理工程师数据治理数据血缘数据安全
北京
•负责集团全链路数据治理规划,制定数据资产盘点方法论,推动数据目录化与资产可视化,实现数据资产可查、可用、可管。
•基于JanusGraph构建字段级数据血缘地图,实现全链路溯源与影响分析,支撑变更风险管控与报表口径一致性核查。
•梳理并优化数据模型,推动维度建模标准化,统一事实表与维度表设计规范,大幅降低数据使用歧义与重复开发。
•建立数据分类分级与脱敏加密机制,确保满足GDPR及个人信息保护合规要求,实现敏感数据访问全程审计。
•主导自研数据治理工具“DataGuard”的核心模块设计,实现元数据自动采集、质量评分与工单闭环,治理效率提升40%。
•项目背景:在线教育业务爆发式增长,用户行为数据、交易数据与课程数据多源异构,导致报表口径不一致,严重干扰运营决策。
•项目目标:建立端到端的数据质量监控体系,保障核心数据资产的可信度,为业务提供可靠数据支持。
•- 设计覆盖完整性、准确性、时效性、一致性四维的数据质量评估指标体系,形成数据质量SLA。
•- 基于Flink与Drools规则引擎开发实时数据质量监控工具,实现数据入湖即校验,异常自动推送至企业微信。
•- 建立数据质量问题分级响应与闭环管理流程,明确责任人、修复时限与复盘机制。
•项目成果:核心数据质量问题下降40%,数据信任度明显提升,业务部门对数据服务的满意度提高25%。
•项目背景:金融科技公司为满足监管报送与精细化运营要求,需整合网贷、理财、保险等十余个业务系统的数据,消除数据孤岛。
•项目目标:设计并实施云原生数据仓库架构,实现数据的集中存储、统一建模与高效共享。
•- 进行全业务域数据需求调研,确定贷款、风控、支付、营销等主题域,形成星型数据模型。
•- 选型ClickHouse与TiDB构建混合数据仓库环境,搭建流批一体数据管道,实现日增数据处理能力达10亿条。
•- 开发全量+增量ETL流程,嵌入数据清洗、标准化与血缘采集,确保数据全链路可追溯。
•- 建立元数据管理系统,提供数据地图、数据字典与自助查询功能,大幅缩短数据发现时间。
•项目成果:成功构建集团统一数据仓库,支持300+核心报表与实时大盘,数据需求响应周期从5天缩短至1天。
对数据秩序有种近乎偏执的追求,享受从混沌中梳理出干净、可信的数据脉络;日常工作中习惯以规范与自动化优先,对数据质量异常和链路隐患保持零容忍态度。技术栈覆盖数据建模、元数据管理、质量监控与安全脱敏,能用脚本与工具把治理动作沉淀为可复用的流程。主动推动跨团队共识,相信好的数据治理不是管控,而是让业务用得更稳、更放心。
数据治理平台实践:
基于Apache Atlas搭建元数据管理原型,开发Python脚本自动采集Hive元数据并解析血缘关系,实现数据血缘可视化。
参与数据质量监控项目,利用SQL与Airflow构建自动化校验任务,对接Superset看板展示数据完整性、一致性等关键指标。