CV

AMAZING RESUME
牛敬业
Java大数据开发工程师
188****0389niu****@***.com北京30男Java大数据开发工程师在职北京25k-35k •系统掌握数据结构、操作系统、分布式系统原理,在课程设计中完成基于Hadoop的电商日志分析工具,实现MapReduce任务调度与数据清洗流程,理解分布式存储与计算思想。
•参加全国大学生大数据技能竞赛,承担Spark数据预处理与特征构建模块,掌握大规模数据管道的优化技巧;同时作为数据开源社区核心成员,组织多次技术分享会,协作完成实时计算框架的文档翻译与代码贡献,锻炼了跨团队沟通与项目管理能力。
北京启明数据科技有限公司 - 大数据研发部高新技术企业
2016.07-2019.12
Java大数据开发工程师分布式计算流处理数据平台
北京
•主导公司数据中台底层架构升级,基于Hadoop、Spark等构建了混合计算引擎,支撑了日均TB级数据的批流融合处理,整体资源利用率提升30%以上。
•设计并开发了实时风控计算系统,通过Flink实现毫秒级事件处理,为业务方提供高时效性的风险识别与拦截能力。
•深入一线业务场景,将数据需求抽象为通用的标签与指标服务,交付了多个面向营销、运营的数据应用模块,显著缩短了数据需求响应周期。
•带领三人小组攻克了数据倾斜、大状态任务恢复等性能瓶颈,沉淀了故障处理手册,大幅提升了团队对复杂大数据问题的应对水平。
北京数联未来技术有限公司 - 大数据事业部行业领先
2020.01-至今
资深Java大数据开发工程师数据治理离线计算实时分析
北京
•作为核心成员参与公司级数据中台建设,主导数据仓库分层设计与实施,构建了覆盖用户、交易、供应链等领域的主题域模型,实现了不同业务线数据的统一治理与共享。
•主导开发了自助式数据洞察平台,通过Presto+Spark引擎实现多维OLAP分析,为管理层提供下钻、对比等灵活的数据看板,辅助制定经营策略。
•从任务调度、数据压缩、Shuffle优化等多维度对大数据平台进行深度调优,使平台数据吞吐量提升50%以上,并保障了7×24小时稳定运行。
•负责部门内技术培训体系搭建,通过代码评审、技术分享等形式提升团队整体技术实力,并带领成员顺利完成多个重大版本迭代上线。
•项目背景:电商业务规模快速扩张,用户行为日志日增量突破百亿,原有分析系统无法支撑实时多维查询,亟需构建新一代大数据分析平台。
•技术架构:采用Hadoop+Spark+ClickHouse+Redis的技术栈,Hadoop作为数据湖底座,Spark负责批量ETL与离线分析,ClickHouse提供即席查询,Redis用于热点数据缓存。
•我的职责:负责从Kafka和业务库中同步采集用户行为及订单数据,进行复杂清洗与回补;基于星型模型设计数据仓库,构建了流量、交易、用户主题域;开发了漏斗分析、留存分析等核心报表,并利用Spark SQL实现秒级查询。
•项目成果:平台上线后,分析师获取洞察的时间从天级缩短至分钟级,直接支撑了首页个性化推荐,带动核心转化率提升12%。
•项目背景:随着智能工厂建设,大量传感器设备接入,产生海量振动、温度等时序数据,需实时分析以提前发现设备劣化倾向,避免非计划停机。
•技术架构:以Flink为核心构建实时流处理引擎,结合Kafka进行数据缓冲,TDengine存储时序数据,并通过Python服务化部署机器学习模型。
•我的职责:设计端到端实时处理管线,对传感器数据进行去噪、插值及特征提取;利用历史数据训练XGBoost故障预测模型,并基于Flink Async I/O实现在线推理;优化Flink状态后端与Checkpoint机制,使系统吞吐量提升至50万点/秒。
•项目成果:实现了对关键设备的实时健康度评估,故障预警准确率达到89%,非计划停机减少40%,年维护成本降低数百万。
对数据工程抱有真切热情,坚信每一行干净的代码和每一次稳定的调度都是业务稳健运转的基石。习惯从数据流向与系统可靠性的角度审视问题,对性能瓶颈有天然的敏感,也享受用技术把杂乱数据梳理成清晰资产的过程。具备扎实的分布式计算与存储技术功底,熟悉流批一体架构,能够将业务语言转化为可落地的数据方案;同时有团队带领经验,乐于推动技术规范与知识沉淀,让协作更高效。希望持续深耕大数据领域,在复杂场景中打磨出更健壮的数据底座。
机器学习与数据挖掘:
熟悉Spark MLlib、Flink ML等分布式机器学习框架,掌握决策树、随机森林、GBDT等集成算法,能基于海量日志数据构建故障检测与根因定位模型。
在运营商网络流量预测项目中,使用XGBoost构建用户带宽需求预测模型,通过滑动窗口特征工程与超参数搜索,将预测误差降低18%,辅助资源动态调度决策。