AMAZING RESUME
188****0459niu****@***.com北京28男大数据Hadoop开发工程师在职北京25k-35k •主修分布式计算、数据挖掘等课程,GPA 3.8/4.0位列专业前8%。
•开发校园能耗监测系统,通过Hadoop处理10万+设备传感器数据,获校级创新项目一等奖。
•担任ACM程序设计协会技术总监,指导队员参加天梯赛获全国二等奖。
大数据Hadoop开发工程师分布式计算优化实时风控系统存储架构设计
北京
•负责金融科技公司Hadoop集群的日常运维与性能调优,通过动态资源调度策略实现节点利用率提升25%,有效支撑日均10TB交易数据处理需求。
•主导搭建实时风控数据管道,利用Kafka+Spark Streaming构建毫秒级风险事件响应机制,将欺诈交易拦截准确率提升至99.2%,直接减少资损超800万元。
•设计分层存储架构,将冷热数据分离至HDFS与对象存储,在保证查询效率的同时降低存储成本30%,相关方案获公司技术创新奖。
大数据Hadoop开发工程师医疗数据治理机器学习建模数据质量体系
上海
•独立设计医疗数据湖架构,基于Hive构建分层数据模型,将跨系统数据整合效率提升40%,支持三甲医院日均300万条诊疗数据实时入湖。
•开发智能问诊辅助系统,通过Spark MLlib构建疾病预测模型,结合患者历史数据实现症状匹配准确率提升35%,已在5家医院上线应用。
•建立数据质量监控体系,设计自动化校验规则覆盖数据完整性/一致性/时效性三维度,使数据问题发现时间从小时级缩短至分钟级。
•项目背景:某市交通管理部门需解决高峰期路网拥堵问题,传统统计方法预测精度不足60%,难以支撑信号灯动态调控需求。
•项目内容:搭建基于Flink+Kafka的实时计算框架,整合地磁线圈、摄像头等多源数据,通过HBase存储历史轨迹数据并训练LSTM预测模型。
•项目成果:实现15分钟粒度的交通流量预测,准确率达89%,辅助优化300+路口信号灯配时方案,使主干道通行效率提升22%。
•项目背景:保理公司需量化中小企业经营风险,传统人工审核周期长达7天,严重影响业务拓展速度。
•项目内容:设计实时数据采集层对接ERP/税务系统,通过Spark GraphX构建企业关系图谱,结合XGBoost模型实现信用评分自动化输出。
•项目成果:将风险评估周期压缩至2小时内,风控模型AUC值达0.87,支撑公司年放款规模突破50亿元。
我热爱大数据开发领域,日常乐于钻研海量数据的存储、计算链路优化,对集群性能指标和代码规范有天然的洁癖,会持续追踪Hadoop生态的技术新动态。做事严谨较真,对数据处理逻辑的准确性要求严苛,沟通协作顺畅,能快速对齐技术目标与业务需求。深耕Hadoop生态栈全链路开发,有从底层架构设计到高并发数据处理难题攻关的落地能力,可针对性输出性能优化方案。擅长跨团队协作推动技术落地,善于从业务数据中提炼可落地的决策支撑,期望能在大数据开发岗位上持续深耕。
2022年度金融科技峰会优秀解决方案奖(实时风控平台) 数据可视化:
精通Metabase搭建动态报表平台,为电商平台设计用户行为分析看板,支持实时GMV波动预警与转化率归因,推动运营团队精准营销策略制定。