AMAZING RESUME / 01
BURN BRIGHT · MOVE FORWARD
牛敬业
Hadoop资深开发工程师
常怀探索之心,以实干沉淀自身价值
188****8615niu****@***.com北京32岁男Hadoop资深开发工程师在职北京30k-40k •在操作系统课程设计中,使用Java实现了一个简易的分布式文件系统原型,深入理解了HDFS的内部机理。
•参加全国大学生大数据竞赛,基于Hadoop完成交通流量批处理任务,负责集群搭建与MapReduce优化,获得华北赛区二等奖。
•担任学院科技协会副主席,策划并组织了“数据驱动校园”系列技术工作坊,累计参与200余人次,提升了团队组织与跨部门协作能力。
•毕业设计围绕Hadoop生态,设计并实现了一个小文件合并与索引方案,验证了在海量文件场景下的存储效率提升。
Hadoop开发工程师离线数据处理Hadoop集群运维数据管道建设
北京
•负责美团外卖用户行为日志的采集与预处理,搭建每日TB级数据清洗流水线,确保数据质量与时效性。
•优化HDFS存储策略,设计冷热数据分层方案,将历史数据迁移至廉价存储,降低集群总体成本约30%。
•与算法团队紧密协作,开发特征工程标准化流程,通过MapReduce和Spark批量生成训练样本,支撑推荐模型迭代。
•编写自动化运维脚本,集成监控告警与自愈机制,将集群故障平均恢复时间从1小时压缩至15分钟。
•定期组织团队内部技术分享,编写《Hadoop开发规范》与《常见问题排查手册》,提升团队整体运维能力。
资深Hadoop开发工程师流批一体架构数据治理平台技术选型规划
北京
•主导京东物流实时数据平台升级,引入Apache Flink结合Hadoop HDFS,实现毫秒级延迟的轨迹与运单数据分析。
•重构YARN资源调度策略,利用Fair Scheduler和队列优先级,将集群资源利用率从65%提升至85%,并保障关键任务SLA。
•带领团队开发数据质量监控系统,覆盖百亿级物流数据,通过规则引擎与异常检测,将数据准确率提升至99.9%。
•推进技术栈升级,制定Hadoop 2.7到3.2的迁移方案,并适配Spark 3.0,大幅提升批处理任务吞吐量。
•关注业界技术趋势,引入Apache Hudi构建数据湖,缩短数据入湖延迟,支撑运营实时看板与即时决策。
•项目背景:美团买菜业务高速增长,亟需对用户从浏览、加购到下单的全链路行为进行实时分析,以驱动精细化运营。
•项目职责:作为核心开发,负责Hadoop集群的选型与搭建,设计数据存储模型,并主导开发Spark ETL作业处理用户行为日志。
•技术实现:基于Hadoop 2.7 + Spark 2.4构建,集群规模80个节点,采用Parquet列式存储与分区策略,利用Spark SQL实现多维聚合分析,并通过Kafka接入实时流。
•项目成果:平台上线后,每日稳定处理千万级用户行为事件,运营活动响应时间缩短50%,期间生鲜品类GMV环比提升15%。
•项目背景:京东物流为优化仓储与末端配送,需深度分析历史订单、库存与运力数据,以预测补货节奏并降低履约成本。
•项目职责:担任技术负责人,负责Hadoop集群性能调优,设计Hive数仓模型,并编写复杂SQL实现供应链指标分析。
•技术实现:对Hadoop集群进行压缩算法与IO调度优化,Hive启用Tez执行引擎,设计星型模型存储订单、仓配、时效等主题,通过多表关联计算库存周转、成本偏差等。
•项目成果:通过分析结果,优化了前置仓补货策略,将库存周转率提升20%,每年节省成本超3000万元。
对数据工程有天然好奇,习惯从海量日志与业务指标中挖掘模式、优化链路,享受用代码把混乱整理成秩序的过程;代码洁癖与稳定性意识很强,容不得管道无故积压或资源浪费,会主动复盘并做预防性治理。深度掌握Hadoop体系各组件的协作与调优,尤其擅长集群治理与计算成本控制。愿意把踩坑经验沉淀为文档或工具,让团队少走弯路,希望持续在数据底座方向深耕。
开源参与:
为Apache Hadoop HDFS的纠删码模块提交了修复方案,解决了解码性能回退问题,补丁已通过社区评审并合入主干;在GitHub上开源了基于Hadoop的实时数据同步工具Syncer,获得200+ Star并被多家企业采用。