•核心课程涵盖分布式数据库、数据仓库建模及并行计算原理,在课程设计中独立完成基于HBase的实时数据统计系统
•连续两年担任学院数据建模竞赛技术负责人,带队获全国大学生数据库设计大赛区域金奖
•参与导师横向课题《金融时序数据压缩算法研究》,相关成果被国内某城商行采用并发表核心期刊论文
ETL开发工程师数据管道设计实时数据流处理数据质量监控
北京
•主导某大型互联网金融公司数据中台建设,使用Python与Hive构建自动化数据管道,日均处理交易量达千万级
•重构历史遗留数据清洗模块,通过并行化处理与增量加载策略,将核心报表生成周期压缩至原有时长的25%
•与风控部门协同设计反欺诈特征工程数据模型,通过实时流批一体架构支撑毫秒级风险决策系统
•建立数据质量监控体系,开发SQL脚本自动检测空值率、主键冲突等异常指标,实现问题数据自动告警
高级ETL开发工程师异构数据整合数据迁移方案性能调优
北京
•负责某知名互联网企业核心业务系统数据迁移项目,采用分区表策略完成PB级历史数据迁移,零停机时间上线
•开发基于Kafka+Spark的动态数据路由引擎,实现异构系统间数据实时同步与格式转换
•通过SQL执行计划分析与索引优化,将复杂多维关联查询性能提升400%,支撑千万级用户画像计算场景
•设计数据血缘追踪系统,可视化呈现跨系统数据流转路径,降低数据变更影响范围评估成本
•项目背景:某银行急需构建毫秒级风险识别系统,传统T+1数据更新模式难以满足业务需求
•项目内容:基于Flink+Kafka搭建流式数据处理链路,开发动态规则引擎实现实时特征计算
•项目成果:系统上线后风险事件识别时效性提升98%,支撑日均500万笔交易实时风控决策
•项目背景:集团并购多家子公司后面临数据孤岛问题,需建立统一数据资产管理体系
•项目内容:设计元数据管理平台,开发自动化数据血缘分析工具,建立跨系统数据标准规范
•项目成果:整合17个业务系统数据,数据资产目录覆盖率从35%提升至89%,支撑集团级经营分析
数据架构与治理:
精通数据仓库分层架构设计,擅长通过星型模型与雪花模型优化复杂查询性能
掌握Hive分区策略与动态分区技术,能将大表查询响应时间控制在秒级
熟悉数据脱敏与权限管控方案,曾设计基于标签的动态数据访问控制系统
技术社区贡献:
在GitHub维护开源ETL工具库,累计获得300+ star,解决用户提出的各类数据迁移问题
定期在技术论坛分享《Spark SQL执行引擎优化实战》系列文章,阅读量突破10万