•深入钻研分布式系统与高性能计算方向,曾参与导师关于大规模集群资源调度的课题研究,发表相关技术论文。
•担任校技术社团核心骨干,组织多场 Linux 内核与开源社区分享会,培养团队对前沿基础设施技术的敏锐度。
•在校期间主导搭建校内开源基础库维护平台,协调多名同学共同推进代码重构,锻炼了对复杂工程项目的管理能力。
高级运维架构师高可用架构服务网格治理混沌工程混合云规划
北京
•主导企业级混合云基础设施的架构规划,设计异地多活容灾方案,将核心业务 RTO 控制在分钟级,RPO 趋近于零。
•引入服务网格(Service Mesh)技术进行流量治理,实现精细化熔断与限流,有效隔离故障域,提升整体集群韧性。
•搭建全链路压测与混沌工程体系,主动注入故障演练系统稳定性,提前识别潜在隐患,规避线上重大生产事故。
•推动 DevOps 文化落地,打通 CI/CD 流水线与自动化运维闭环,显著降低发版风险,支撑业务敏捷迭代与高频发布。
•负责大规模 Linux 集群的底层运维与性能调优,通过内核参数定制与 IO 优化,支撑海量并发访问场景。
•设计并实施自动化交付流水线,实现应用从代码提交到生产上线的无人值守,交付效率提升数倍。
•构建立体化监控告警体系,整合日志、指标与链路追踪,实现异常秒级发现与智能根因分析。
•参与安全合规加固工作,完善漏洞扫描与应急响应流程,确保系统符合国家信息安全等级保护标准。
企业级混合云资源调度与监控体系建设 - 架构负责人
2019.01-2020.12
•作为架构核心,设计跨公有云与私有云的统一资源池,解决多云环境下资源孤岛与调度不均衡难题。
•引入全链路压测框架,模拟极端流量冲击,验证系统弹性伸缩策略,确保大促期间服务不降级。
•构建统一可观测性平台(Observability),整合 Prometheus、Grafana 与 ELK,实现从基础设施到业务代码的透视化管理。
•优化容器编排策略,利用 K8s Operator 模式管理无状态应用,大幅简化运维操作复杂度,降低人为误操作风险。
大规模实时数据湖架构设计与稳定性保障 - 技术核心
2014.01-2016.12
•参与大数据基础架构演进,主导从传统 Hadoop 向存算分离架构转型,显著提升存储成本效益与计算弹性。
•优化 Flink 流式计算任务的资源分配策略,解决数据倾斜导致的延迟问题,保障实时数据处理的时效性。
•建立数据血缘追踪与自动备份恢复机制,确保海量数据资产的安全性与可追溯性,应对极端数据丢失场景。
•协同数据开发团队优化数据链路,提升数据湖吞吐能力,有力支撑公司商业智能分析与 AI 模型训练需求。
技术影响力与社区:
活跃于 CNCF 社区,作为 Committer 参与云原生相关开源项目维护,贡献代码被广泛合入主干分支。
常怀探索之心,以实干沉淀自身价值,定期在技术峰会发表主题演讲,分享架构演进与稳定性建设经验。