•系统学习计算机网络、Linux系统管理、分布式系统与云计算原理等课程,深入理解大规模系统架构与运维基础。
•加入校内科创实验室,参与“基于Kubernetes的容器化应用发布与监控平台”搭建,实践自动化部署与监控告警配置。
•担任校运维社团副社长,组织“线上故障模拟演练”与“运维工具链分享会”,锻炼跨团队协调与应急响应能力。
•获“中国大学生服务外包创新创业大赛”二等奖,项目涉及大数据平台监控与容量规划,提升数据驱动运维能力。
•毕业设计“基于ELK与机器学习的智能运维告警系统”,获优秀毕业论文,展示在日志分析与故障预测方面的实践能力。
北京数联科技有限公司 - 数据运维中心高新技术企业数据中台解决方案提供商
2016.07-2019.12
大数据运维工程师数据中台运维存算分离架构标准化巡检
北京
•负责公司自研数据中台的日常运维保障,涵盖服务健康监控、容量预警、慢任务治理及突发故障应急响应。
•参与数据中台从存算一体到存算分离的架构拆解,推动弹性扩缩容与多租户隔离方案落地,提升平台资源利用率。
•编写并持续迭代运维SOP与标准化巡检手册,将人工操作转化为可审计的自动化流程,降低人为失误。
•与数据开发、安全团队协作,建立数据分级保护与离线/实时链路的统一监控看板,为业务提供稳定的数据基座。
•通过日志分析、指标告警和全链路追踪,主动发现数据倾斜与资源争抢隐患,将核心链路可用性维持在99.9%以上。
北京数源互联网有限公司 - 数据平台运维部互联网行业领军企业数据驱动型科技公司
2020.01-至今
高级大数据运维工程师集群治理自动化交付容灾与数据治理
北京
•带领4人运维小组,管理近千台节点的大数据集群,负责集群规划、部署交付、监控体系构建与持续调优。
•设计并实施基于Kubernetes与声明式编排的自动化运维方案,将集群扩缩容、版本升级等操作实现一键化,显著缩短交付周期。
•参与公司同城双活数据中心的建设,主导数据同步策略制定与容灾演练,确保数据零丢失与分钟级切换。
•协同业务部门梳理数据需求,主导数据治理项目,搭建冷热数据分层存储与生命周期管理方案,降低存储成本。
•定期组织技术分享会,输出《大规模集群故障排查手册》与《Ranger权限管理最佳实践》,带动团队技术成长。
•主导公司数据中台从耦合架构到存算分离的架构演进,负责整体方案设计与技术选型。
•对现有集群进行资源画像分析,梳理计算与存储痛点,提出基于HDFS与对象存储的分层架构,并制定灰度迁移计划。
•主导新架构的部署与集成测试,协调各方解决兼容性问题,确保历史数据平滑迁移且业务无感。
•优化分布式计算引擎的参数与调度策略,使大表关联任务的处理速度提升约40%,同时降低存储瓶颈。
•与开发团队紧密配合,将架构变更封装为平台能力,并输出存算分离运维白皮书,保障后续维护标准化。
•负责公司大数据集群的同城容灾扩容项目,以满足业务爆发式增长对数据规模与可靠性的双重要求。
•制定整体扩容方案,包括新机房选址评估、网络专线规划、服务器选型与存储系统架构设计。
•主导集群跨机房部署与数据同步实施,采用联邦机制实现统一命名空间,确保在线服务平滑切换。
•扩容后对集群进行全链路压测与性能调优,重点解决跨机房读写延迟问题,将核心作业延迟控制在可接受范围。
•与业务团队定期对齐资源水位,建立容量预测模型,提前输出扩容建议,支撑业务连续性。
大数据平台运维(Hadoop/Spark/Flink) 数据库与NoSQL管理(MySQL/HBase/Redis) 自动化运维(Ansible/Terraform/K8s) 行业交流与开源贡献:
定期在DataOps社区进行《海量数据集群的自动化运维体系构建》等主题直播,分享脚本化运维与监控体系建设经验,覆盖听众逾千人。
向开源监控项目Prometheus社区提交过关于告警规则优化与exporter扩展的PR,被合入主线,提升了告警准确率与社区协作能力。
持续维护内部Wiki及技术博客,编撰“数据库运维故障诊断手册”与“Hadoop集群调优实战”系列,成为团队新人快速上手的重要参考资料。