牛敬业
188****8999niu****@***.com北京30男Hadoop数据处理工程师在职北京25k-35k •作为核心成员参加全国大学生大数据竞赛,负责数据清洗与特征工程,使用Spark MLlib构建购买预测模型,获华北赛区二等奖。
•主导校内实验室日志分析平台后端开发,实现Flume+Kafka+HDFS日志采集与存储,支撑日均50GB日志数据。
北京某数字营销技术公司 - 数据平台部数字营销广告技术
2016.07-2019.12
Hadoop数据处理工程师Hadoop集群运维广告数据处理ETL链路优化
北京
•负责公司广告数据平台Hadoop集群的搭建与日常运维,保障日均TB级广告日志的稳定接入与存储。
•主导广告投放数据的ETL链路设计,使用Hive、Spark完成点击、曝光、转化数据的清洗、聚合与加载,将全链路处理耗时从3小时压降至1.5小时。
•与优化团队协同,根据广告投放效果数据构建多维分析宽表,支撑实时竞价策略调整,助力广告主ROI平均提升8%。
北京某智慧城市大数据企业 - 大数据研发部智慧城市大数据处理
2020.01-2023.06
资深Hadoop数据处理工程师Hadoop架构升级团队管理智慧交通数据处理
北京
•主导公司Hadoop集群向存算分离架构演进,引入对象存储与容器化部署,集群整体吞吐量提升25%,存储成本降低18%。
•带领5人团队完成智慧交通大数据处理项目,处理每日PB级车联网传感器数据,设计分层数据仓库支撑车辆轨迹回放、拥堵预测等场景。
•建立团队Hadoop开发规范与代码审查机制,定期组织Spark性能调优专题分享,推动团队首次将批处理作业失败率控制在0.3%以内。
在线教育平台用户学习行为分析系统 - Hadoop技术负责人
2017.05-2018.03
•项目目标是为在线教育平台构建用户学习行为分析系统,支持课程推荐与学习路径优化。
•作为Hadoop侧负责人,独立完成HDFS与YARN集群的规划与部署,设计冷热数据分层存储策略。
•利用Hive对用户观看时长、互动、测验等离线行为数据进行清洗与主题建模,日处理数据量约800GB。
•通过Spark Streaming实时处理用户登录、答题等事件流,实现学习异常实时预警,端到端延迟控制在2秒内。
•最终交付统一行为分析报表,为平台提供章节完成率、内容偏好等洞察,辅助课程迭代后用户完课率提升12%。
•项目旨在为物流企业分拨中心构建智能调度数据底座,整合包裹信息、车辆轨迹、分拣设备状态等数据。
•负责Hadoop集群的数据预处理链路,清洗、去重并关联来自多个业务库的异构数据,初始数据规模约30TB。
•运用MapReduce设计自定义聚合算法,对包裹分拣路径进行特征提取,生成包裹流向热力图与分拨时效特征表。
•重构数据处理流程,将全量数据更新周期从6小时压缩至2.5小时,满足分拨调度准实时决策需求。
•最终为运筹调度模型提供高质量特征数据,使分拨中心日均处理包裹量提升18%,错分率下降4%。
着迷于用代码驯服海量数据,始终把数据准确性与处理效率放在第一位;对分布式系统有天然的亲近感,习惯从底层存储格式到上层计算逻辑全面优化,追求每一段ETL都像精密仪器般可靠。善于将复杂的业务需求转化为可维护的脚本流水线,并持续关注技术演进,愿将这份热爱与严谨注入到数据处理工程师的日常工作中。
Linux运维与自动化运维:
精通Linux系统调优与进程管理,可快速完成Hadoop生态组件(HDFS/YARN)的部署与参数调优,保障集群吞吐量。
利用Bash与Python开发自动化工具链,实现集群日志聚合与异常告警,将故障响应时间缩短60%以上。