AMAZING RESUME
牛敬业
188****9387niu****@***.com北京32男大数据挖掘专家在职北京30k-40k •• 主修概率统计、深度学习前沿课程,GPA 3.85/4.0位列专业前5%,在「百度之星」编程竞赛中获区域三等奖
•• 加入实验室计算机视觉项目组,负责医疗影像数据集清洗,应用Spark优化处理流程,数据可用性提升40%
•• 撰写技术博客系列《大数据实践指南》,在InfoQ平台发表,单篇最高阅读量8.2万,沉淀工程化经验
•• 主导在线教育平台学员学习行为深度挖掘,基于多模态数据(视频停留时长、互动轨迹)构建知识图谱驱动的个性化学习路径,学员完课率提升32%,精准度达82%
•• 重构短视频内容推荐底层逻辑,引入图神经网络融合用户社交关系与内容语义,用户日均使用时长增加18%,冷启动内容曝光量翻倍
•• 设计实时数据湖架构,采用Delta Lake替代传统星型模型,将运营看板生成耗时从60分钟压缩至12分钟,支撑日均千万级数据写入
•• 与教育产品团队共建用户增长漏斗分析体系,挖掘关键转化节点,推动付费转化率提升12%,月活用户净增50万+
•• 指导4名成员完成NLP情感分析项目,组织月度技术沙龙聚焦算法工程化,团队模型部署效率提升40%
•• 为外卖平台构建骑手异常行为检测模型,融合GPS轨迹与订单上下文,采用隔离森林算法实现欺诈识别准确率97%,年减少资损超2000万元
•• 针对商户交易流水进行深度特征工程,通过时序交叉特征挖掘,提升欺诈评分模型AUC至0.89,误报率下降35%
•• 基于Kafka Streams搭建实时风控管道,将风险事件响应时间从分钟级优化到150毫秒,动态拦截高风险订单占比达95%
•• 联动策略团队制定信用额度动态调整规则,基于挖掘结果优化授信逻辑,坏账率同比降低15%,商户满意度提升28%
•• 带教2名新人完成供应链风险预测项目,方案获公司年度最佳实践奖,推动跨部门数据协同流程标准化
•• 项目背景:为三甲医院预测患者30天再入院风险,优化医疗资源配置效率
•• 数据处理:整合电子病历、检验报告等非结构化数据,清洗PB级医疗记录,构建患者健康时间序列库
•• 模型构建:采用集成学习融合临床指标与生活方式数据,结合LSTM预测高风险患者,测试集准确率达78%
•• 成果:模型驱动干预方案使目标患者再入院率降低25%,年度节省医疗成本超3000万元
•• 技术难点:通过NLP提取临床文本关键信息,设计注意力机制解决数据稀疏性问题
•• 项目背景:为连锁超市优化生鲜品类库存管理,减少损耗并保障供应稳定性
•• 数据采集:聚合POS流水、气象数据及社交媒体趋势,覆盖5000+门店日销数据
•• 特征工程:应用Prophet算法解析季节性波动,构建包含70个动态特征的时间序列模型
•• 模型训练:对比XGBoost与LightGBM,通过贝叶斯优化提升预测精度,AUC达0.91
•• 部署应用:集成至ERP系统实现自动补货,库存周转率提升35%,损耗率下降18%
• 对大数据挖掘有近乎执念的热爱,享受在海量数据中抽丝剥茧发现规律的过程,坚信数据是商业决策的隐形引擎。工作中以严谨为底色,对数据质量近乎苛刻,习惯用代码注释讲述数据故事。精通大数据生态与机器学习工程化,擅长将抽象算法转化为可落地的业务价值。坚持每周参与开源社区贡献,通过工具包优化数据链路效率;定期在技术社区输出深度实践,推动行业知识共享。求职意向聚焦数据智能创新,期待在复杂场景中持续突破技术边界。
大数据生态应用(Spark Streaming/Kafka/Flink) 机器学习模型调优(GBDT/Deep Learning) 数据工程工具链(Python/Pandas/SQL) 开源社区参与:
• 在Apache Spark社区提交数据清洗优化PR,提升Spark SQL处理效率15%,获核心维护者采纳
• 在KDD 2023大会发表实时数据挖掘实践演讲,分享毫秒级风控架构设计,引发行业讨论