•课程攻坚:深入研习《并行计算》《存储系统》等核心模块,独立完成基于一致性哈希算法的分布式缓存原型设计。
•竞赛历练:组队参加 ACM 区域赛并入选省队,主攻图算法优化方向,显著提升了复杂场景下的代码调试与性能分析能力。
•实践落地:协助导师搭建实验室分布式实验环境,使用 ZooKeeper 协调节点管理,实现多服务间的配置动态同步与故障转移。
大数据平台开发工程师实时数据架构流批计算数据治理
北京
•主导金融级实时数据中台搭建,完成数据接入层、计算引擎与元数据管理模块设计,支撑日均50TB+交易数据处理
•通过引入Flink CDC与分层缓存机制,将核心业务指标延迟从小时级压缩至秒级,故障恢复时间缩短至5分钟内
•协同业务方构建风控模型数据供应链,设计动态特征工程管道,使反欺诈模型迭代效率提升40%
•建立标准化数据质量监控体系,覆盖数据血缘追踪、异常告警与自动修复流程,数据可用性达99.95%
大数据平台开发工程师湖仓架构数据中台元数据管理
北京
•设计电商全域数据中台,整合跨业务线数据资产,支持日均3000万+订单的实时分析场景
•基于Iceberg构建湖仓一体架构,实现存算分离与动态schema管理,存储成本降低35%
•开发智能数据血缘系统,通过SQL解析与执行计划追踪,建立全链路数据依赖图谱
•推动数据服务API化,为业务方提供自助式数据查询与分析能力,减少60%重复开发需求
•构建金融级实时风控数据底座,支撑日均8亿条交易流水的毫秒级风险识别
•基于Flink+RocksDB实现增量特征计算引擎,将模型特征生成延迟从分钟级降至100ms
•设计多维度异常检测算法,通过动态阈值与图计算识别团伙欺诈行为,误报率降低55%
•与业务方共建数据产品,输出风险洞察看板与自动化预警机制,覆盖信贷、支付等核心场景
•负责电商业务全域数据整合,设计分层数据模型支撑GMV、转化率等核心指标计算
•开发Airflow+Hive调度系统,实现跨业务线数据资产T+1小时级更新,覆盖商品、用户、订单等12个域
•构建数据质量评分体系,通过SQL扫描与业务规则校验,异常数据拦截率提升至98%
•推动数据服务化,开发统一API网关,支持业务方通过SQL即时查询实时数据,响应时间<500ms
开源社区与架构演进:
跟踪 Apache Hadoop 生态动态,主导搭建基于 YARN 的资源隔离测试环境,验证不同调度策略下集群吞吐量的差异表现。
探索存算分离架构落地,通过对比 ClickHouse 与 Doris 在 OLAP 场景下的查询延迟,输出内部技术选型评估报告。
沉淀运维自动化脚本库,涵盖 MySQL 主从切换与 Elasticsearch 集群健康检查,降低日常巡检人工成本约 40%。