AMAZING RESUME
牛敬业
生物信息高性能计算后端开发
常怀探索之心,以实干沉淀自身价值
188****1232niu****@***.com北京30男生物信息高性能计算后端开发在职北京25k-35k •硕士阶段聚焦生物信息后端工具与高性能计算融合,带队从零构建了基于Spark的基因组结构变异实时检测引擎,将TB级测序数据的分析延迟压缩至分钟级,并集成到实验室自动化管线中。
•作为主力参加国际基因工程机器大赛(iGEM),负责干实验模块,使用Rust与Python开发了一款代谢通路快速模拟器,帮助团队获得银牌;同时担任《生物信息学编程实践》课程助教,引导本科生通过Ray并行框架优化转录组拼接流程。
•深入修读分布式存储、异构计算等课程,并牵头搭建了基于Kubernetes的校内生信分析平台,为多个课题组提供弹性扩缩容的序列比对与变异注释服务,沉淀了扎实的工程化交付能力。
北京元码生物科技有限公司 - 计算平台部生物科技高新技术企业
2018.07-2022.06
高级生物信息计算工程师高性能计算生物信息学系统架构
北京
•主导公司新一代蛋白质组学云平台的后端架构设计,针对每日产生的数百GB质谱数据,引入MinIO分布式对象存储并设计冷热分层策略,将数据持久化成本降低45%,同时吞吐量提升60%。
•开发了基于Flink的实时蛋白质鉴定并行计算模块,通过优化窗口状态管理和算子链,使大规模搜库速度提升3倍,每年为部门节省云端计算资源开支约60万元。
•与蛋白质组学研发团队紧密配合,深入理解蛋白质翻译后修饰分析流程,将复杂的统计学算法重构为高效的Python/Rust混合计算管线,使修饰位点鉴定准确率提升20%。
北京智源生物信息研究院 - 数据科学部生物信息科研机构
2016.07-2018.06
生物信息计算开发工程师生物信息处理算法优化后端服务
北京
•参与构建公司代谢组学数据库系统,设计基于Elasticsearch的分布式索引引擎,实现了千万级代谢物谱图的亚秒级检索,检索响应时间从6秒缩短至0.8秒。
•开发了基于Rust的短序列比对加速库,通过无锁数据结构与向量化指令优化,将宏基因组学数据比对速度提升50%,在处理深海微生物批量样本时效果尤为显著。
•负责设计统一的数据API网关,制定了对生物实体、谱图、注释等资源的标准化RESTful交互协议,使前后端数据交互错误率从3%降低至0.5%以下。
•项目背景:单细胞测序技术的普及使单次实验产生的数据量激增至TB级,传统分析流程耗时过长,急需一套可扩展的并行计算方案。
•项目成果:作为架构师,设计了基于Dask和Ray的混合并行计算流水线,将单细胞转录组数据分析周期从48小时缩短至8小时以内。系统上线后处理了超过3000例样本,基因表达定量准确率达到98%。
•技术实现:使用Python和Cython进行核心算法开发,结合Redis缓存中间结果,利用Kubernetes实现弹性伸缩,大幅提升了计算资源利用率。
•项目背景:为统一管理多组学、多模态生物数据,公司决定构建一个高可用、可扩展的数据湖,以支撑下游AI模型训练与实时查询。
•项目成果:主导设计了基于Kubernetes和MinIO的云原生数据湖架构,实现了PB级多组学数据的统一存储与访问。通过开发Go语言编写的数据索引微服务,使全文检索速度提升10倍以上。
•技术实现:使用Go进行后端服务开发,集成Apache Arrow实现高效内存列式分析,采用S3协议统一存储接口,并通过Prometheus+Grafana构建监控体系,保障数据服务的高可用性。
对生命科学大数据背后的计算挑战充满热情,乐于在序列比对、变异检测等流程中挖掘性能瓶颈,追求极致的执行效率。我习惯深入底层,注重代码质量与资源开销,能在分布式框架下设计轻量且高吞吐的管线。日常技术栈覆盖 Spark、C++、容器化与分布式存储,对算法复杂度与数据流优化敏感。与生物学家协作时,能快速理解领域术语,把模糊需求翻译成稳定、可扩展的后端服务,希望持续在生物信息高性能计算方向深耕。
大规模组学数据流水线加速:
深挖单细胞测序分析中的性能瓶颈,基于C++17与oneAPI重写了核心降维与聚类算子,并利用Slurm作业数组实现多样本并行调度,成功将十万级细胞的全流程分析周期从4.5小时缩短至1.2小时,相关流水线已稳定支撑实验室的肿瘤异质性研究。