北京航空航天大学 - 本科985工程211工程双一流
2013.09-2017.06
•- 投入多项课程设计及学科竞赛,独立实现过基于Multi-Paxos的分布式日志复制系统,获全国大学生系统能力大赛二等奖;参加ICPC亚洲区域赛,积累了大规模数据处理与问题分解能力。
分布式计算后端开发工程师分布式系统后端开发高并发优化
北京
•负责分布式计算平台后端核心模块开发,采用Java与Go混合编程,基于Spring Cloud微服务体系,设计并实现弹性任务调度、资源隔离与动态扩缩容功能,使任务处理吞吐量提升40%。
•参与分布式对象存储系统重构,与团队协作完成数据分片策略优化、多副本强一致性协议实现,系统上线后支撑日均50亿+数据读写操作,数据可用性达99.99%。
•主导技术选型与架构升级,引入Redis Cluster作为分布式缓存层,优化热点数据访问模式,将系统平均响应时间降低55%。
•负责代码质量保障,制定并推行《后端开发规范》,组织每周代码评审,引入SonarQube静态分析,线上故障发生率下降80%。
分布式计算后端开发工程师分布式训练后端开发容器化架构
北京
•参与分布式机器学习平台后端开发,使用Python与Go语言,基于PyTorch与Kubernetes,实现千卡级模型训练任务的分布式调度与弹性资源管理,训练速度提升50%。
•负责数据预处理流水线模块开发,设计流批统一的数据清洗、特征工程算法,处理多源异构数据,日均处理数据量达TB级。
•优化系统架构,引入容器化部署与Service Mesh,实现服务无状态化与灰度发布,服务模块数量增加40%,系统维护成本降低35%。
•与算法、产品团队深度协作,以敏捷迭代方式交付多个推荐模型训练平台版本,获得部门季度之星表彰。
•项目背景:为支撑广告业务实时竞价与报表,建设一套低延迟、高吞吐的流式计算平台。
•项目职责:作为核心开发人员,负责计算引擎层开发。采用Java与Flink,设计基于事件时间的窗口聚合算法,实现毫秒级延迟的实时指标计算。
•技术实现:基于Kafka实现多源数据接入,利用RocksDB作为状态后端;设计Checkpoint机制保障精确一次语义;引入背压控制与动态并行度调整,提升系统稳定性。
•项目成果:平台上线后,承载日均200亿+事件处理,端到端延迟小于50ms,支撑实时竞价与监控大盘,计算资源成本降低30%。
•项目背景:构建全链路追踪系统,满足微服务架构下分布式调用链分析与故障定位需求。
•项目职责:主导后端架构设计与开发。使用Go语言,基于OpenTelemetry标准,设计分布式追踪数据采集、存储与查询架构。
•技术实现:自研高性能Agent完成数据采集,使用Elasticsearch存储Span数据,开发采样策略与智能聚合算法,实现调用链拓扑图实时生成与异常检测。
•项目成果:系统上线后,实现全链路毫秒级检索,日均处理100亿+Span,故障平均定位时间从30分钟缩短至3分钟,MTTR降低90%。
开源项目与技术分享:
深度参与Apache Hadoop、Kubernetes等社区贡献,为调度器与存储模块提交过若干关键补丁,在GitHub主持多个Star数超过2k的分布式中间件项目。
长期在CSDN、公众号等平台撰写分布式系统实践文章,发表《自研分布式任务调度框架》《共识算法在流处理中的应用》等系列内容,累计阅读量突破60万,技术影响力稳步提升。