AMAZING RESUME · SOFT RADIUS
牛敬业
Hadoop数据挖掘工程师
188****4322niu****@***.com北京30男Hadoop数据挖掘工程师在职北京25k - 35k •负责校级创新项目“基于Hadoop的图书馆借阅记录关联分析”,设计MapReduce作业挖掘读者兴趣模式,获优秀毕业设计。
•参加全国大学生大数据技能竞赛,运用Hive与Spark完成多源日志清洗与特征构建,团队获华北赛区二等奖;主修课程包括大数据技术、分布式数据库、数据挖掘与知识发现,综合成绩进入专业前10%。
•发起校内大数据技术社团,组织Hadoop/Spark系列讲座与实战营,并参与Apache项目文档汉化,提升技术传播与协作习惯。
Hadoop数据挖掘工程师离线计算用户画像推荐系统
北京
•负责公司外卖业务线的Hadoop平台运维与优化,保障每日10亿级日志数据的实时接入与离线处理,集群月度可用性达99.9%。
•主导用户画像建设项目,利用Hive构建多维度标签体系,并基于Spark MLlib训练外卖偏好预测模型,使首页个性化推荐点击率提升25%,客单价提升8%。
•与产品、运营团队协作,梳理业务痛点并设计数据挖掘方案,通过A/B实验验证数据策略,推动发券、排序等模块的持续迭代。
Hadoop数据挖掘工程师数据仓库图计算性能调优
北京
•构建公司物流数据仓库,基于Hadoop搭建贴源层与集市层,管理超80TB数据,日均调度任务超过600个,支撑供应链全链路分析。
•带领团队开展仓储路径优化项目,运用Spark SQL和GraphX对包裹流转网络进行图计算,识别低效转运节点,使全网平均时效缩短12%,运输成本降低5%。
•持续进行Hadoop集群性能调优,通过重构压缩算法、调整YARN调度策略,将核心作业平均执行时间减少35%,大幅节约计算资源。
外卖平台商家经营分析及智能推荐 - 数据挖掘工程师
2017 - 03-2017 - 12
•项目背景:某外卖平台期望通过挖掘商家经营数据,为商家提供选品建议并优化曝光排序,提升整体交易额。
•项目过程:负责数据采集与特征工程,使用Flume抽取订单、评价等数据,经MapReduce清洗后存入HDFS。利用Hive构建商家分层模型,融合菜品销量、复购率等指标。最终基于Spark ALS与XGBoost训练混合推荐模型,实现个性化商家推荐。
•项目成果:推荐模块上线后,商家曝光点击率提升28%,平台整体下单转化率提升12%,月度GMV增长约8%。
•项目背景:某物流公司需对全国转运网络进行优化,并实时发现分拣异常,以减少包裹延误。
•项目过程:使用Hadoop YARN进行资源管理,基于Spark GraphX构建全国转运枢纽图模型,通过Louvain算法划分物流子网,找出瓶颈节点。同时开发实时异常检测模块,利用Spark Streaming结合孤立森林算法,对包裹扫描数据进行监控。
•项目成果:定位并优化了12个关键转运节点,全网平均时效缩短12%;异常检测准确率达95%,分拣异常响应时间从小时级降至分钟级,显著改善客户体验。
对数据背后的规律与模式充满探究欲,偏爱用分布式计算与算法把模糊提问转化为可落地的洞察。我信奉严谨的工程习惯与可解释的模型,总在追求数据质量与链路稳定性,不轻易放过任何异常波动。乐于将业务直觉翻译成指标体系,既能独立推进数据项目闭环,也能在团队中快速对齐需求,期望在数据挖掘岗位上持续交付有说服力的分析结果。
开源经历:
在GitHub上开源了多个Hadoop运维辅助工具,如NameNode故障自动切换脚本与YARN资源监控看板,累计获得1500+ Star,已被多家互联网公司引入生产环境。