AMAZING RESUME · OPEN HORIZON
牛敬业 AI数据标注员
188****7959 niu****@***.com 北京 25岁 男 AI数据标注员 在职 北京 8k-12k • 在校期间深耕计算机视觉与数据挖掘基础理论,修读了机器学习、统计学及数据库系统核心课程,具备扎实的数理逻辑基础。
• 曾主导校级大学生创新创业项目,负责社区垃圾分类数据集的清洗与分类模型验证,积累了从原始数据采集到最终落地的完整经验。
• 课余活跃于技术论坛,热衷于分享数据清洗脚本与效率工具,曾在校级数学建模竞赛中负责数据处理模块,获得校级二等奖。
AI数据标注员 多模态数据治理 标注 SOP 制定 数据质量监控
北京
• 主导多模态素材库的构建与维护,覆盖视觉识别与语音转写场景。制定详细的标注作业指导书(SOP),将复杂业务规则转化为可执行的操作标准,显著降低新成员上手门槛。
• 建立数据质量全链路监控机制,引入自动校验脚本辅助人工复核。定期复盘典型错误案例,推动标注规范迭代 3 次,使整体交付合格率稳定在高位。
• 负责标注产出的终审工作,针对边界模糊样本建立争议库。与算法团队保持高频对齐,将模型 BadCase 反馈转化为标注规则的修正依据,形成数据 - 模型闭环。
• 协同产品与算法团队完成需求评审,准确理解业务场景对数据粒度的要求。在资源有限的情况下,通过优先级排序与任务拆解,保障核心项目数据的及时交付。
AI数据标注员 对话语料工程 RLHF 数据筛选 文本清洗
北京
• 负责对话式 AI 语料库的构建工作,涵盖问答对生成、意图分类及情感倾向判断。利用文本清洗脚本预处理原始语料,剔除噪声数据,确保输入模型的数据纯净度。
• 搭建标注问题知识库,沉淀常见歧义句型的处理逻辑。定期组织团队分享会,推广高效标注技巧,帮助新员工缩短磨合期,提升整体作业速度。
• 参与大模型 RLHF(人类反馈强化学习)数据筛选项目。依据人类偏好对模型输出进行排序与打分,协助优化模型的对齐能力,使回答更符合人类价值观。
• 定期进行数据维度统计分析,输出标注进度与质量周报。针对数据分布不均的情况提出采样建议,帮助算法团队调整训练策略,提升模型在长尾场景下的表现。
• 该项目旨在构建电商场景下的高精度商品识别模型。作为质检负责人,主导制定了涵盖 SKU 属性、品牌 Logo 及遮挡处理的复杂标注规范。
• 带领小组攻克长尾商品识别难点,针对相似款式的细微差别建立对比图库,统一了团队对「同类不同款」的判定标准,减少主观误差。
• 引入双层质检机制,实行标注员互检与组长抽检相结合。项目期间处理图像样本超 8 万张,最终验收准确率达到 99%,为视觉搜索功能上线提供了核心支撑。
• 针对标注过程中发现的算法盲区,整理输出《易错样本分析报告》,协助算法团队优化模型对模糊图像的特征提取能力。
• 参与医疗/法律垂直领域的知识图谱构建,负责实体抽取与关系定义工作。深入研读行业文档,梳理出涵盖 20 余个实体类型的标注体系。
• 针对文本中存在的歧义实体进行消歧处理,建立实体对齐规则库。确保同一概念在不同文档中被统一映射,提升了知识图谱的连通性。
• 处理文本数据约 30 万条,重点攻克多跳关系识别难题。通过人机协作模式,将复杂关系的标注效率提升了 40%,为下游推理应用打下基础。
• 定期与 NLP 算法工程师沟通标注难点,共同迭代标注工具的功能模块,实现了部分标准化关系的自动预标注,减轻了人工负担。
我对数据背后的逻辑有着天然的敏感度,坚信高质量的数据是 AI 模型智慧的基石。性格上偏向严谨细致,对标注规则中的歧义点有「死磕」到底的习惯,不愿将模糊或错误的数据流入下游训练环节。具备扎实的计算机基础与数据清洗能力,擅长在复杂业务场景下提炼可执行的标注规范。热爱人工智能行业,享受通过数据标注推动算法迭代的过程,期待在数据工程领域持续深耕,以匠心打磨每一份训练素材,为模型赋能业务场景贡献力量。
数据隐私与伦理合规:
熟悉《个人信息保护法》及 GDPR 中关于数据脱敏的条款,具备较强的合规意识。在过往实践中,能够识别并妥善处理涉及人脸、身份证等敏感信息的样本,确保数据流转符合法律规范,为项目合规性提供保障。