•参加全国大学生数据挖掘挑战赛和ACM-ICPC亚洲区域赛,使用随机森林与XGBoost完成流式日志分类,两度获得省级奖项,强化了算法落地与工程化能力。
•为Apache Hadoop项目提交了3个关于DataNode心跳机制优化的补丁,其中2个已被合并,深刻理解了分布式存储的可靠性与容错设计。
•毕业设计《基于Flink的实时日志异常检测与根因定位系统》,独立完成从数据采集到告警的全链路原型,验证了流式处理在运维场景中的可行性。
•作为技术社团负责人,多次组织Hadoop性能调优和Prometheus监控实战沙龙,积累了团队知识传递与运维文档沉淀的经验。
大数据运维工程师集群稳定性保障容量规划自动化运维故障诊断
北京
•主导公司电商大数据平台日常运维,覆盖Hadoop、Spark、Flink等核心组件,通过模块化监控指标和自动化脚本,将集群故障发现时间从分钟级缩短至秒级,全年P0级故障为零。
•针对大促期间的流量洪峰,提前进行容量评估与弹性扩容方案设计,联动资源团队完成数百节点预扩容,保障大促期间平台吞吐量峰值承载能力提升4倍,无任何性能降级。
•搭建基于日志的根因分析辅助系统,将常见故障处理经验沉淀为诊断规则,配合开发团队优化了30余个数据管道瓶颈,使数据延迟降低40%以上,显著提升下游推荐和报表的时效性。
•推动运维工具体系化建设,使用Python与Shell编写部署、巡检、告警聚合等自动化工具,减少重复操作,使日常运维人力投入降低约50%。
大数据运维工程师基础设施运维数据容灾监控告警系统迁移
北京
•负责公司社交大数据平台的基础环境建设与维护,涵盖物理机、虚拟机、容器等异构资源的统一管理,通过标准化部署流程,将新集群交付周期从2周缩短至3天。
•制定并落地多级数据备份与容灾方案,结合异地冷备和实时双活,使数据恢复点目标(RPO)达到秒级,并在一次分布式存储节点批量故障中,通过快速切换和并行恢复,零业务中断完成数据重建。
•构建分层监控体系,从基础设施、系统服务到业务指标实现全链路可观测,优化告警抑制和升级策略,将误报率降低70%,并主动发现并修复了多个潜在的内存泄漏和磁盘耗尽风险。
•参与离线数仓迁移项目,负责Hive元数据迁移和作业兼容性验证,通过编写兼容性检测脚本,确保上万条调度任务平滑迁移,无数据错漏。
•项目背景:公司电商业务数据量突破百PB级,离线数仓的ETL链路耗时过长,严重影响次日运营报表和算法模型的刷新,需要系统性优化。
•项目目标:在保障数据一致性的前提下,将核心数仓作业的完成时间提前2小时以上,提升下游数据消费体验。
•项目内容:负责Hadoop集群层面的参数调优、中间件升级和计算资源细粒度调度。通过引入YARN公平调度器与标签化队列,隔离高优作业;对Hive SQL进行模板化改写,并优化ORC文件格式的压缩策略,大幅降低Shuffle传输量;同时构建了作业执行时的资源消耗审计工具,指导开发团队优化倾斜任务。
•项目成果:核心作业平均执行时间缩短35%,集群资源利用率从60%提升至78%,全年节省计算成本约25%,数据产出时效性显著提升,支撑了多个实时化运营场景的落地。
实时数据中台存储与灾备建设项目 - 大数据运维工程师
2017.01-2017.12
•项目背景:社交业务数据格式多样、写入峰谷明显,原有存储架构存在单点风险和扩展瓶颈,无法满足未来业务增长需要。
•项目目标:构建一套高可用、可弹性伸缩的实时数据存储平台,并建立完备的灾备体系,确保极端情况下数据零丢失。
•项目内容:负责分布式存储系统的选型测试、部署架构设计和灾备方案落地。采用Ceph与HDFS混合存储分层,冷热数据自动流转;设计并实施跨机房同步方案,结合Erasure Coding技术,在保证可靠性的前提下降低存储冗余成本;编写了一键式故障切换与数据恢复工具包,并定期组织容灾演练。
•项目成果:建成后的存储平台可用性达到99.99%,在多次机房网络抖动中实现自动切换零感知;单GB存储成本下降18%,数据恢复演练速度提升4倍,为后续实时推荐和画像系统提供了稳定基座。
运维工具开发与自动化:
熟练使用Python与Shell构建自动化运维工具链,曾开发一套基于Ansible的集群自动化部署与健康检查框架,支持一键扩缩容和异常自愈,将日常运维操作耗时降低约40%。
设计并落地了基于ELK的高可用日志分析平台,通过自定义解析规则与告警策略,将故障定位效率从小时级压缩至分钟级,并在团队内推广使用。