牛敬业
数据仓库研发专家
BUSINESS PROFILE
电话188****8081
邮箱niu****@***.com
城市北京
年龄35
性别男
求职状态在职
•主修数据库系统原理、分布式计算等核心课程,完成基于HBase的半结构化数据存储优化课题,成果发表于CCF-C类会议
•担任校计算机协会技术部长,组织3次大数据技术沙龙,带领团队开发校园课程推荐系统,获校级创新创业大赛一等奖
•参与导师承担的教育部重点项目,负责异构数据源ETL模块开发,实现多源异构数据标准化处理流程
数据仓库研发专家分布式系统架构存储引擎优化数据资产治理
北京
•主导构建金融级分布式数仓底座,采用分层架构与冷热数据分离策略,支撑日均1.2PB数据吞吐,通过计算引擎优化使核心报表生成时间缩短55%
•设计企业级数据资产目录系统,建立跨业务域的主题模型与指标体系,解决30+业务线的数据孤岛问题,数据复用率提升至82%
•搭建实时数据同步管道,整合交易、风控等6个核心系统,实现毫秒级数据一致性校验,将异常数据发现时效从天级压缩至分钟级
•推动存算分离架构升级,引入对象存储与分布式缓存层,使存储成本下降35%,同时支持业务弹性扩展至3倍规模
数据仓库高级工程师流批一体架构数据服务化质量监控体系
北京
•负责电商平台数据仓库日常运维,设计动态分区策略与智能索引机制,使OLAP查询响应速度提升40%,支撑日均2000万次数据请求
•开发数据质量监测平台,实现字段级血缘追踪与异常告警,将数据问题发现周期从T+1缩短至实时,错误率控制在0.08%以内
•主导ETL流程重构,采用流批一体架构替代传统定时任务,数据处理时效提升60%,节省计算资源25%
•建立数据服务API网关,封装核心指标计算逻辑,使业务部门自助取数效率提升3倍,减少重复开发工作量70%
•设计湖仓一体架构方案,整合交易、征信、行为等12类数据源,采用Iceberg表格式实现ACID事务支持,数据更新延迟降至秒级
•开发实时特征计算引擎,基于Flink+Hudi技术栈构建用户画像系统,支持300+特征字段分钟级更新,模型特征覆盖率提升80%
•建立数据服务标准化体系,通过Dataflow DSL实现指标自动计算与血缘追踪,使风控策略迭代周期从周级缩短至小时级
•构建基于TDengine的时序数据仓库,设计多级索引与压缩算法,存储成本降低60%,查询性能提升5倍
•开发实时流处理管道,整合边缘计算节点数据,实现设备状态秒级监控与预警,覆盖500+工业客户
•建立数据质量校验框架,通过规则引擎与机器学习模型识别异常数据,数据可用率提升至99.95%
对数据架构有近乎偏执的严谨态度,习惯用代码实现逻辑闭环。擅长在复杂业务场景中快速定位数据链路瓶颈,通过分布式存储与计算架构重构提升系统吞吐量。持续关注云原生数据湖技术演进,曾主导设计跨业务域的数据血缘追踪方案,将元数据管理效率提升3倍。求职意向聚焦数据底座建设,期待参与大规模实时数仓与批流一体架构的攻坚。
数据资产管理:
构建企业级元数据管理平台,实现数据血缘自动采集与影响分析,支持1000+数据表的变更影响评估
设计数据生命周期策略,通过冷热分层与归档机制,将存储成本降低45%同时保持数据可追溯性