•加入校内大数据技术工坊,带队参加“城市交通流量预测”挑战赛,使用 Spark SQL 对出租车轨迹数据完成拉链表处理,结合 LightGBM 完成小时级流量预估,方案被收录为教学案例且获校一等奖。
云数据仓库工程师数据仓库分层物化视图优化资源调度
北京
•负责本地生活业务线的云数据仓库建设,依据订单、骑手、商家等多维数据需求,重新设计数仓分层架构,引入数据湖仓一体方案,使跨主题分析效率提升35%。
•主导日常数据质量监控体系搭建,针对字段缺失、指标口径不一致等问题制定自动化稽核规则,通过DataWorks+自定义脚本实现异常分钟级告警,保障600+核心报表的准确率。
•深入理解外卖与到店业务的运营逻辑,与产品、运营协作设计用户留存与商圈热力分析模型,推动自助分析平台的指标沉淀,使业务取数周期缩短50%。
•带领3人小组攻克高峰期实时写入与批量ETL争抢计算资源的难题,通过Fine-Grained调度策略与弹性Resource Group设计,将集群资源利用率提升至75%,并消除任务堆积。
云数据仓库工程师跨云迁移CICD数据管道权限治理
北京
•主导出行交易数据仓库从自建Hadoop集群到阿里云MaxCompute的完整迁移,重写300+张核心表的DDL并适配UDF,采用双跑验证方案确保数据零丢失,迁移后存储成本降低45%。
•设计并落地数据安全分级方案,结合RAM角色与列级权限控制,实现针对司机、乘客隐私字段的细粒度访问管理,并通过日志审计满足合规要求。
•重构ETL编排流程,用DolphinScheduler替换原有Crontab模式,引入增量合并与小文件合并策略,使全量数据刷新时间从6小时缩短至2.5小时以内。
•建立团队内部数据仓库开发规范与Code Review机制,编写《数仓设计checklist》并组织7次内部培训,辅导2名初级工程师具备独立负责主题域的能力。
•项目为某大型连锁零售企业构建全渠道云数据仓库,整合门店POS、线上商城、会员CRM及供应链数据,支撑经营日报与智能补货分析。
•作为模型设计核心成员,采用维度建模与Data Vault结合的方式,设计了销售、库存、会员三大主题域,通过缓慢变化维处理商品价格调整历史,提升分析灵活性。
•开发ETL流水线,使用DataX进行多源异构数据抽取,编写Spark SQL完成复杂清洗与去重逻辑,并构建数据质量衡量指标,将脏数据率控制在0.3%以内。
•针对Top 20高频报表查询进行专项优化,通过合理设置分区键、利用Bitmap索引与预计算聚合表,让平均查询响应时间从8分钟降至2分钟以内。
•项目上线后,帮助客户实现每日自动推送经营分析报告,及时识别滞销品与高潜门店,库存周转率提升18%。
•为某财险公司搭建云上数据仓库,用于整合车险、健康险等保单数据、理赔记录与客户画像,支持精算与风险预警。
•作为技术负责人,设计多租户隔离的湖仓一体架构,采用OSS存储原始文件,通过MaxCompute+Spark进行分层加工,确保高可用与弹性扩展。
•主导数据质量监控模块开发,利用Flink实时检测理赔数据中的重复报案、金额异常等问题,并联动业务系统自动挂起工单,异常事件发现及时率提升至99.2%。
•联合精算师团队,基于历史赔付数据构建客户风险评分模型,使用XGBoost在Spark MLlib上训练,模型KS值达到0.38,为差异化定价提供依据。
•交付后,客户月度理赔分析报告产出时间由3天缩短至4小时,IT基础设施成本降低约30%。
云原生数据仓库(MaxCompute/Redshift) 数据建模与智能运维实践:
熟悉特征工程全流程,曾基于数据仓库中的用户行为宽表,设计 RFM 衍生特征并构建逻辑回归、随机森林等模型,将预测结果回写至数据仓库,为营销自动化提供可信标签。
在运维场景中,利用时序异常检测算法(如基于 Prophet 的动态阈值)对集群 CPU/IO 指标进行监控,将报警规则沉淀为数据仓库中的监控维表,辅助 DB 运维同学提前发现慢查询风险。