188****2468niu****@***.com北京30男NLP高级算法工程师在职北京30k-40k •深入研习机器学习与模式识别理论,主修高级算法分析与分布式系统设计课程,为后续从事大规模语言模型研发积累了深厚的数理基础。
•主导参加“中国大学生计算机设计大赛”,负责自然语言处理赛道的算法攻关,基于改进的注意力机制模型在文本生成任务中获得国家级二等奖,该项目代码开源后在社区获得广泛关注。
•负责金融风控领域的文本反欺诈算法研发,主导了非结构化数据特征工程优化。通过引入多任务学习框架,在稀疏标签数据下,将欺诈文本识别的 F1 值从 78% 提升至 88%,并将模型推理延迟降低了 25%,该方案落地于核心风控引擎,有效降低了坏账率。
•参与企业级知识中台建设,设计并实现了文档语义检索与聚类算法。采用基于 Transformer 的稠密向量检索模型,结合 BM25 稀疏检索,使文档召回率提升 15%;利用无监督聚类算法对海量文档进行主题归纳,通过层级聚类优化,将文档管理效率提高了 30%,为内部知识共享提供了底层支持。
•负责团队算法规范的制定与评审,定期组织模型性能复盘会,提升团队整体交付质量。同时,与业务方深度协作,根据场景痛点制定算法迭代计划,推动产品功能的快速验证与上线。
•带领团队攻克企业级智能文档处理项目的算法难题。负责整体 pipeline 设计,采用文档布局分析模型结合 OCR 后处理技术,实现了复杂表格还原与版式保留功能。通过模型量化与 TensorRT 加速,使文档处理吞吐量提升了 60%,解析精度显著改善,该产品上线后内部文档数字化率提升了 50%。
•主导公司 NLP 中台算法服务化改造,将文本摘要、关键词抽取、实体链接等核心能力进行微服务封装,提供高并发 API 接口,支持跨部门调用。目前该服务已支撑多条业务线,算法复用率提升 40%,显著降低了重复开发成本。
•关注产业界与学术界动态,定期调研新技术(如多模态大模型、检索增强生成等)在办公场景的应用可行性。成功将对比学习应用于文档相似度比对任务,使比对准确率提高了 18%,应用于内容去重与归档系统,提升了信息管理的精准度。
•项目背景:金融机构每日产生海量研报,分析师难以及时捕捉核心观点,亟需自动化工具辅助信息提取。
•项目目标:开发高精度研报摘要生成模型,能够从长文本中提炼关键投资逻辑与结论。
•技术方案:采用 Extractive + Abstractive 混合生成框架。首先利用生物信息学领域的序列标注模型提取关键句,再基于 Transformer 架构进行摘要重写。引入对抗训练机制解决金融术语表达不统一问题。
•项目成果:模型在内部评测集上的 ROUGE-L 分数达到 0.45,关键信息保留率达 92%。系统部署后,分析师研报阅读效率提升 40%,辅助投资决策更加及时准确。
•项目背景:医院电子病历多以自由文本形式存在,数据利用价值低,需进行结构化处理以支持临床科研与辅助诊断。
•项目目标:构建高精度医疗实体与关系抽取系统,支持多模态病历数据(文本、检验单)的解析。
•技术方案:首先构建医疗领域本体库,利用 BiLSTM-CRF 模型进行实体识别,结合远程监督方法抽取疾病 - 症状 - 药物关系。引入外部医学知识图谱进行后校验,纠正模型错误预测。
•项目成果:系统在标准医疗语料上的实体识别 F1 值达到 91%,关系抽取准确率为 87%。落地后,科研数据准备时间缩短 50%,有效支撑了多项临床课题的数据分析需求。
我是一名对自然语言处理充满热情的算法工程师,坚信文本背后蕴含的逻辑价值。具备严谨的代码规范和模型验证习惯,追求算法在业务场景中的极致效率。精通深度学习框架与预训练模型微调,擅长解决复杂语义理解问题。加分项在于持续关注大模型前沿动态,并乐于在技术社区分享实践经验。常怀探索之心,以实干沉淀自身价值。
PyTorch/TensorFlow 模型训练与部署 技术社区贡献:
活跃于开源生态,在 GitHub 维护了多个 NLP 工具包(如高效文本分词库、轻量级实体链接模块等),累计获得数千 Star,助力开发者快速构建原型系统。
定期在技术专栏发表深度解析文章,如《大模型微调实战指南》《知识图谱构建避坑手册》等,累计阅读量突破十万,与行业同行建立了良好的技术交流网络。