•在数据库课程设计中,独立完成一个多语种词典查询工具,使用Python与SQLite实现跨语言模糊检索,初次体验语料库构建。
•参加全国大学生服务外包创新创业大赛,负责多语种评论情感分析,基于BERT完成中英日三语微调,获国家三等奖,锻炼了数据清洗与模型调优能力。
•作为核心成员开发“译路通”辅助翻译平台,负责平行语料对齐模块,实现中英日三语自动对齐,积累了机器翻译数据迭代的实战经验。
北京深蓝智语科技有限公司 - AI研发部人工智能领域创新企业高新技术企业
2015 - 07-2018 - 12
•主导医疗文献机器翻译模型的训练全流程,针对临床试验报告、医学论文等场景,设计分阶段训练策略,确保领域术语翻译准确率。
•对50万+中英双语医疗语料进行深度清洗与标注,构建了包含ICD编码、药品名称、手术术式等专业词库,严格把控数据质量。
•基于PyTorch框架搭建Transformer模型,并引入稀疏注意力机制,使长距离医学描述的翻译连贯性提升15%。
•与算法团队协作,设计A/B测试方案,通过BLEU、TER等指标联合评估,识别并修复了模型在罕见病名上的误译问题。
•实时监控训练过程中的loss震荡与梯度爆炸,采用动态学习率调整与梯度裁剪,保障了10轮迭代内模型稳定收敛。
•积累了跨语种、跨领域训练经验,深入理解医学、法律等垂直场景下翻译模型的瓶颈与优化方向。
北京数译未来科技有限公司 - AI产品研发中心行业领先的互联网企业创新型科技公司
2019 - 01-2021 - 06
高级AI机器翻译训练师团队管理金融翻译流程优化
北京
•带领5人训练团队,负责公司核心金融文档翻译产品的训练迭代,制定季度OKR并拆解为双周冲刺任务,确保交付节奏。
•将预训练语言模型(如mBERT)与对比学习框架结合,优化金融长句的语义对齐,使年报、招股书等文件的翻译可读性大幅提升。
•与头部券商客户深度沟通,将对方对合规术语、数据隐私的关切转化为具体的训练约束条件与评估规则。
•主导开发了基于主动学习的半自动标注流水线,通过对低置信度样本的智能筛选,将人工标注成本降低30%。
•建立团队内部技术分享机制,每周组织论文精读与代码复现,推动成员掌握最新seq2seq变体。
•作为产品委员会成员,从训练视角提出“领域自适应切换”功能,被纳入产品核心路线图,推动了产品差异化竞争。
中英法律合同智能翻译优化项目 - AI机器翻译训练师
2016 - 05-2017 - 03
•项目目标为提升中英法律领域的翻译质量,我负责训练策略制定。收集了30万条中英法律平行语料,涵盖合同、判决书、专利文本。
•对语料进行精细化预处理,针对法律术语(如“不可抗力”“管辖权”)做实体识别与对齐,并构建了领域术语表。
•采用课程学习策略,先让模型在通用语料上预训练,再逐步注入法律数据,避免灾难性遗忘,最终模型在合同条款上的BLEU值提升至42.3。
•与法务专家合作,对500条翻译结果进行人工评测,针对条款歧义、句式生硬等问题进行强化学习微调,项目成果上线后,法律类翻译的客户采纳率提升25%。
多语言技术文档本地化翻译项目 - 高级AI机器翻译训练师
2019 - 05-2020 - 12
•该项目为某跨国软件公司提供中英、中德、中法三语技术文档翻译服务。我作为训练负责人,组建了跨语言攻关小组。
•针对技术文档中的代码片段、API名称、UI术语等,制定了“零误翻”约束策略,并收集了20万条技术文档对作为训练数据。
•引入基于标签的领域适配模块,使模型能快速切换至不同产品线风格。通过对比解码,使长段落的逻辑结构保持完整,技术参数无遗漏。
•搭建了自动化回归测试流水线,每次模型更新后自动运行3000条测试用例,确保翻译质量不退化。最终交付后,客户将人工校对工作量减少了60%,项目续约率100%。
2021年度公司杰出技术贡献奖(智能医疗翻译项目) 2022年度AI创新团队奖(多语言技术文档翻译项目) 语言能力:
英语CET-6,可无障碍阅读并提炼ACL/EMNLP会议论文要点,参与过英文语料标注与校对项目;日语N2,能独立阅读日文技术文档并辅助完成过日文客服问答对清洗,具备多语种语感。