•主修数据结构、算法设计、操作系统、数据库等课程,并参加“全国大学生服务外包创新创业大赛”,在限时环境下完成“智能客服工单自动分类”原型开发,锻炼了快速理解业务需求与特征工程构建的能力。
•以项目组长身份完成“基于深度学习的电商评论情感分析”课程设计,主导数据清洗、中文分词、停用词过滤及TextCNN模型的实现,通过混淆矩阵分析优化分类阈值,最终项目获院级优秀设计奖。
•毕业设计课题为《基于BERT的短文本多标签分类研究》,独立设计数据增强策略、微调预训练模型并完成消融实验,论文被推荐为优秀毕业论文,为后续从事AI训练师工作积累了完整的模型迭代与评估经验。
北京数智科技有限公司 - AI研发部智能科技数据服务
2017.01-2021.06
AI文本分类训练师文本分类意图识别数据标注规范模型运营
北京
•主导智能客服对话意图分类模型的训练与迭代,针对金融、政务等多个行业场景,设计细粒度的意图标签体系,并通过主动学习策略筛选高价值样本进行标注,将模型线上准确率提升至92%。
•与数据标注团队协同制定分级标注指南,引入预标注脚本与一致性校验工具,将标注错误率降低40%,保障了百万级训练语料的质量与交付效率。
•搭建线上模型效果监控看板,实时追踪分类准确率、覆盖率及业务反馈,针对节假日、舆情热点等数据分布变化,快速触发模型重训与灰度上线,确保模型持续适配业务。
•组织团队内部技术分享,分享Prompt Engineering在少样本分类场景下的实践,以及模型轻量化部署方案,推动知识沉淀与团队能力提升。
北京鹏程网络技术有限公司 - AI算法部互联网技术创新
2015.07-2016.12
AI算法工程师(文本分类方向)深度学习自然语言处理模型优化算法工程化
北京
•负责大规模互联网内容安全文本分类系统的算法研发,带领技术小组探索基于Transformer的层次化多标签分类模型,有效识别违规、低俗、广告等细粒度类别,召回率提升15%。
•主导训练性能优化,通过混合精度训练与分布式数据并行策略,将模型训练周期缩短35%;利用模型量化与图优化技术,将推理延迟降低至毫秒级,满足高并发场景需求。
•与产品、运营团队紧密配合,将文本分类模型集成至内容审核中台,成功赋能资讯流、短视频评论等多个业务线,日均处理文本量超亿级,大幅降低人工审核成本。
•参与多次行业技术峰会,吸收并落地半监督学习、对比学习等前沿方法,为团队技术选型提供关键参考,并撰写内部技术白皮书,沉淀算法实践经验。
•项目旨在构建一套面向金融、快消等行业的企业舆情风险多级分类引擎,将每日抓取的新闻、公告、论坛帖文自动归类为正面、负面、争议及各类风险事件。
•作为项目负责人,首先完成数据采集与清洗:从数百个信源接入原始文本,利用正则与实体识别技术进行去噪、去重,并组织团队完成10万条数据的人工标注,定义清晰的分类标准。
•算法设计上,采用BERT-base作为基座模型,注入外部知识图谱中的实体关系信息,构建增强型文本表示。在对比学习框架下进行微调,有效提升对长尾风险事件的识别能力。
•训练过程中引入对抗训练与数据增强(回译、同义词替换),增强模型鲁棒性。经过多轮迭代,模型在测试集上的宏平均F1值达到89%,较基线模型提升12%。
•最终将模型封装为RESTful API,部署在Kubernetes集群上,实现新闻文本的实时自动分类,并为客户提供风险告警与可视化报表,已稳定服务多家头部企业。
•该项目为某大型电商平台构建客服对话意图识别模型,用于自动识别用户咨询中的购买咨询、售后投诉、物流查询、闲聊等十余种意图,以提升智能路由与回复效率。
•首先,收集并整理平台近半年的客服对话日志,对文本进行清洗、脱敏,并基于弱监督方法生成初始标注,再通过众包校对获得高质量训练集。
•采用迁移学习策略,以中文预训练模型RoBERTa为底座,设计多任务学习结构——同时进行意图分类与关键槽位提取,使模型能理解更细粒度的用户意图。
•在模型训练中,引入Focal Loss解决类别不均衡问题,并利用R-Drop正则化提升模型泛化性。经过调优,模型在验证集上的准确率达94%,F1值0.91。
•模型上线后,集成至对话管理平台,日均调用量超百万次,客服意图识别准确率提升至93%,人工转接率下降18%,有效降低了运营成本。
文本语义分析与特征工程:
熟练掌握词法分析、依存句法、实体识别、关键词抽取等NLP基础技术,并能将其灵活应用于文本分类的特征增强。例如,在新闻分类比赛中,通过实体链接将文本中的公司名、产品名关联到知识图谱,并利用句法树提取主谓宾三元组作为补充特征,使模型在财经新闻长尾类别上的F1值提升约6个百分点。