•系统修读分子生物学、遗传学、概率统计等基础课程,并深入学习序列比对、隐马尔可夫模型、聚类与分类算法等生物信息核心算法,夯实算法设计基础。
•参与导师主持的“基于单细胞RNA-seq的肿瘤异质性研究”课题,独立完成上游测序质控、序列比对及下游差异表达分析,自研Python脚本实现多批次样本的自动化处理,显著提升分析效率。
•硕士期间GPA 3.8/4.0,连续两年获校级学业一等奖学金,并作为核心成员协助实验室搭建变异注释流程,获得导师高度认可。
北京某基因科技股份有限公司 - 生物信息研发部医疗健康领域
2018.07-2021.12
•• 主导肿瘤NGS数据分析流程的核心算法重构,通过并行化改造与新的变异比对策略,使全流程处理耗时降低约30%,碱基质量校正准确率稳定在99.5%
•• 作为早期成员搭建自动化测序分析平台,设计并实现质控、比对、变异注释等核心模块,平台目前每月可完成500余例临床样本的检测任务
•• 与产品注册团队协作,推动算法成果整合进公司肿瘤靶向测序试剂盒,该试剂盒获批上市后累计销售额达到5000万元
•• 持续关注前沿计算方法,将一维卷积网络引入胚系突变位点检测模型,相比旧流程使低深度区域的检测灵敏度提升20%
北京某生命科学研究院 - 生物信息算法中心科研机构
2022.01-至今
•• 负责公司重点课题“多组学整合的复杂疾病风险预测”,带领5人算法团队完成基因组、转录组及表观数据的统一建模,模型在留出集中的准确率达85%
•• 重构药物靶点相互作用预测流程,改进负样本构造策略并引入图神经网络,使候选靶点召回率从70%提升到80%,为研发管线提供更可靠的靶点排序
•• 建立组内代码评审与技术分享机制,累计组织专题工作坊20余次,显著提升团队在特征工程与模型评估方面的专业度
•• 作为单位算法负责人参与国家级科研合作项目,完成算法模块的需求拆解与实现,与合作机构共同推进的成果已在国际权威期刊发表
基于多组学特征的抗癌药物反应预测模型 - 算法负责人
2019.05-2021.05
•• 项目缘起:临床亟需根据肿瘤分子特征筛选优势用药人群,减少无效治疗带来的负担
•• 项目实施:整合5000余例患者的体细胞突变、拷贝数变异与用药随访数据,构建以XGBoost为核心的多分类响应预测框架,并进行严格的特征选择与交叉验证
•• 项目成效:独立验证集AUC达到0.85,系统已嵌入临床辅助决策流程,累计为200余例患者提供个性化用药建议,其中约四成患者因方案调整获得临床获益
•• 个人职责:主导样本纳入标准、标签定义与特征工程,完成超参数调优并撰写技术文档,确保模型具备临床可解释性
面向低频突变的卷积神经网络识别流程重构 - 算法核心成员
2022.03-至今
•• 问题提出:原有生信流程对超深测序中的低频体细胞突变召回不足,且计算耗时随数据量增大而明显增加
•• 方法设计:将碱基质量与比对信息编码为二维特征图,利用轻量卷积网络捕获局部错配模式,并设计基于测序深度的数据增强以提升低丰度信号检出能力
•• 结果落地:模型检出准确率由传统流程的90%提升至95%,单样本分析时间缩短约50%,已部署至测序平台,月度处理数据量持续超过10TB
•• 职责担当:负责模型构建与训练加速,完成多组对比实验验证技术方案的有效性,并协同运维团队推进容器化部署与线上监控
发明专利:
作为第一发明人申请发明专利1项:《一种基于深度学习与上下文窗口的基因变异检测方法》,已授权(专利号:ZL 2023*******.X),该专利融合序列上下文特征与神经网络模型,有效提升低频变异识别的准确性。