AMAZING RESUME
牛敬业
大数据开发工程师
常怀探索之心,以实干沉淀自身价值
188****5067niu****@***.com北京30男大数据开发工程师在职北京25k-35k •在校期间重点钻研了分布式存储、流计算引擎与大规模数据处理框架等课程,并基于 Flink 搭建了实时日志分析系统,完成了从数据采集到可视化展示的全链路实践,由此确立了数据工程方向。
•作为核心成员参与“鲲鹏杯”全国高校大数据应用挑战赛,通过用户画像与实时推荐任务获得华东赛区一等奖,在高压迭代中锻炼了模型调优与工程化部署能力。
•曾担任开源技术俱乐部副主席,组织过多次 Hadoop 生态组件系列工作坊与线上故障排查演练,推动社区形成了持续学习与主动分享的工程师文化。
•负责金融风控数据平台的设计与优化,基于 Spark、Hudi 和 HBase 构建湖仓一体架构,处理每日数十 TB 级交易与日志数据,使批量计算延迟降低 40%,存储成本下降 25%。
•主导实时反欺诈指标计算体系的建设,使用 Flink 与 Kafka 实现毫秒级特征加工,支撑 2000 万用户交易行为的实时风险判别,试点期间有效拦截可疑交易占比提升 15%。
•重构数据血缘与审计链路,将原本需要 5 小时的全量审计过程压缩至 1.5 小时,并引入自动校验机制,确保数据质量始终保持在 99.95% 以上。
•与风控策略团队紧密协作,开发自助分析工作台,将策略迭代实验的反馈周期从 3 天缩短至半天,显著提升了风险规则的响应速度。
•主导物流数据仓库的设计与建模,使用 Hive 和 Spark SQL 构建分层架构,管理 PB 级轨迹与运单数据,为仓储、配送等多个业务线提供统一的数据出口。
•开发数据质量监控框架,集成多种校验规则与异常告警,将数据脏数据率控制在 0.01% 以下,保障了大数据分析的可信度。
•搭建多渠道数据接入管道,统一对接 IoT 设备、业务数据库、合作伙伴 API 等异构数据源,日处理增量数据达 20 TB,并实现数据就绪时间缩短 60%。
•组织内部技术沙龙与代码规范评审,编写数据开发最佳实践文档,帮助新入职员工在 2 周内掌握核心开发流程,提升团队整体交付质量。
•项目背景:为满足在线教育平台对用户学习深度分析的需求,构建学习行为分析系统,以驱动课程推荐与产品迭代。
•技术实现:使用 Filebeat 采集前端埋点与日志,Kafka 作为消息缓冲,Structured Streaming 进行实时处理,将学员的观看、答题、互动等行为实时聚合,计算完课率、注意力指数等指标。
•项目成果:系统上线后,为教学团队提供了实时学情看板,基于数据优化了课程互动环节,使重点课程的完课率提升了 18%,同时根据学员流失原因分析,及时推出干预策略,将月度流失率降低 12%。
•项目背景:公司业务线增长迅速,原有报表工具无法满足多主题、灵活组合的分析需求,决定建设全域数据洞察平台。
•技术实现:基于 Spark 和 ClickHouse 搭建高速计算与查询引擎,使用 Hive 进行离线数据预处理,通过 Metabase 实现多维度自助分析,支持用户拖拽生成报表与看板。
•项目成果:平台覆盖公司 90% 的业务线,用户可在 5 分钟内生成定制化报表,较之前缩短 80% 的制作时间。通过对转化的深度分析,发现某品类库存周转异常,优化后降低库存成本 10%,并及时调整了补货策略。
对数据工程的魅力保持着长期热忱,喜欢从海量信息中构建稳定、高效的流转体系,这种搭建“数据管道”的过程让我沉浸其中。我习惯追求代码的简洁与可维护性,对性能优化有天然的敏感,也愿意为了一个调度延迟问题反复排查调优。技术栈围绕Hadoop生态与实时计算展开,擅长数仓分层设计与ETL流程治理,始终将数据准确性与系统健壮性放在首位。结合业务视角去理解指标口径,能与上下游顺畅对齐,既能沉下心做底层建设,也乐于在技术方案上表达自己的思考。希望持续深耕大数据领域,在解决复杂工程问题的同时保持技术成长。
数据监控与看板工程:
熟练使用 Superset、Redash 与 AntV/G2 等工具链,能够快速构建面向运维与业务的数据大屏,将关键指标异常检测前置。曾为数据平台团队搭建了集群资源水位与作业延迟监控看板,使异常响应时间从 15 分钟缩短至 3 分钟,有效保障了数据管线的 SLA。