•深入修读并行计算、分布式存储等前沿课程,设计并实现基于 HDFS 的图片存储与检索系统,在千万级文件场景下优化小文件合并策略,获评校级优秀课程项目。
•带队参加华为云大数据挑战赛,利用 Hadoop 生态完成海量网络日志的实时清洗与多维聚合,排名全国前 10,锻炼了大规模集群的调优与故障排查能力。
Hadoop生态系统开发工程师分布式存储调优YARN调度HBase治理Hive引擎
北京
•• 负责公司数据中台 Hadoop 集群的规划与深度调优,重构 HDFS 副本策略并引入纠删码技术,在保证数据可靠性的前提下将存储成本降低 20%,同时读写吞吐量提升 25%。
•• 主导 MapReduce 到 YARN 的作业迁移与优化,设计基于标签的调度器实现作业优先级隔离,关键 ETL 作业平均执行延迟缩短 35%,支撑了每日千万级订单的实时汇总需求。
•• 参与 HBase 集群的扩缩容与 Region 热点治理,通过预分区与 RowKey 散列设计,使峰值写入 QPS 稳定在 8 万/秒,保障了用户画像标签的毫秒级查询。
•• 与 SRE 和数据开发团队紧密配合,推动 Hive on Tez 引擎切换及 YARN 队列资源弹性伸缩策略,使交互式查询响应时间下降 50%,平台整体 SLA 提升至 99.95%。
Hadoop生态系统开发工程师数据湖Flink实时处理资源弹性Hadoop联邦
北京
•• 负责公司数据湖架构选型与落地,主导 Apache Iceberg 与 Hadoop 生态的集成,构建流批一体的实时数仓存储层,统一了离线与实时数据链路。
•• 优化 Hadoop 集群资源分配策略,实施动态资源池与弹性伸缩机制,使集群资源利用率提升 30%,在应对大促流量时数据处理吞吐量翻倍,ETL 任务 SLA 达成率 99.9%。
•• 开发基于 Flink + HDFS 的实时数据清洗管道,替代原有 Storm 方案,实现毫秒级延迟的实时日志解析与维度关联,将数据可用性提高到秒级,直接赋能推荐与风控系统。
•• 持续跟进 Hadoop 社区技术趋势,引入 Hadoop 3.2 的 EC 码和 YARN Federation 特性,使冷数据存储效率提升 40%,并完成多机房多集群的联邦部署。
金融交易实时风控与反欺诈数据处理平台 - 数据平台架构师
2017.01-2017.12
•• 项目背景:公司金融业务交易量激增,传统批处理架构无法满足实时风控对数据新鲜度的要求,急需构建毫秒级延迟的数据处理底座。
•• 项目职责:作为架构师,负责 Hadoop 集群的搭建与安全配置,设计基于 Kafka + Logstash 的实时日志采集方案,统一接入交易、日志、设备指纹等多源数据。
•• 技术实现:使用 HDFS 作为原始数据湖,通过 Spark 流批一体作业进行清洗、去重与特征衍生,结果分层写入 Hive 分区表和 HBase 实时特征库。引入数据倾斜自适应处理机制,使 Shuffle 阶段溢出减少 70%,作业执行效率提升 50%。
•• 项目成果:平台上线后,实时处理日均 5TB 交易数据,风控模型决策延迟从分钟级压缩至秒级,坏账率降低 10%,同时为精准营销提供实时用户画像,营销响应率提升 18%。
•• 项目背景:工厂数千台 CNC 设备需要实时监控运行状态,传统离线报表无法及时发现早期故障征兆,计划用大数据技术实现预测性维护。
•• 项目职责:主导 Flink + Hadoop 集成方案设计,搭建实时数据处理管道,负责 HBase 宽表设计以存储设备高频时序状态数据。
•• 技术实现:使用 Flink 从 Kafka 消费设备传感器数据,进行滑动窗口聚合计算(如振动频谱、温度梯度),结果实时写入 HBase 并同步到 Hive 进行离线训练。优化 Flink 状态后端与 Checkpoint 机制,确保系统稳定处理每秒 2 万条设备事件。
•• 项目成果:实现了设备亚健康状态实时预警,故障预警时间提前至分钟级,非计划停机时间减少 30%,维护成本降低 15%,形成可复制的工业数据解决方案。
ZooKeeper 协调框架:
精通 ZooKeeper 的会话管理、Watcher 机制与分布式共识算法,曾基于其实现 Hadoop 集群的配置中心与命名服务,并利用 Curator 封装了可重入的分布式锁,解决了多租户环境下 YARN 资源调度的竞态问题。