AMAZING RESUME
188****4415niu****@***.com北京30男数据库监控工程师在职北京15k - 25k •完成数据库系统、操作系统、计算机网络等核心课程,并选修《高性能数据库技术》与《云原生数据库》,动手实现基于 LevelDB 的存储引擎原型,理解索引与事务机制。
•作为队长参加“OceanBase 数据库大赛”,利用 Prometheus 监控集群指标,分析慢查询并优化 SQL 执行计划,最终获得全国三等奖。
•参与学校数据库实验室的“智能运维”项目,开发基于 Python 的监控脚本,实时采集数据库状态并预警,提升异常发现效率。
•担任计算机协会副会长,组织技术沙龙“数据库故障排查实战”,促进团队协作和技术分享。
融信数科(北京)有限公司 - 运维保障部金融科技国家高新技术企业
2015.07-2018.12
•面向金融支付业务,主导数据库集群的7×24监控,部署 Prometheus + Grafana 方案,对 OLTP 核心库的关键指标(QPS、慢查询比率、复制延迟、磁盘吞吐)进行秒级采集与可视化。两年间预判并化解了十余次因锁升级、执行计划突变引发的性能抖动,通过优化慢 SQL 和调整缓冲池参数,将核心交易库的 P99 延迟降低了 35%。
•参与故障应急处理流程的迭代优化,编写自动化诊断脚本,集成在告警触发时自动抓取数据库状态快照、锁等待链和错误日志。在一次因硬件故障导致的主库不可用事件中,快速决策切主并协调应用方完成流量切换,45 分钟内恢复业务,将数据丢失风险控制在秒级以内。
•定期输出数据库健康度评估报告,从容量趋势、资源瓶颈、热点表等维度给出治理建议,推动计费系统从单机 MySQL 向 MySQL + Redis 读写分离架构演进,整体可用性提升至 99.99%。
北京云数科技 - 数据库技术中心云计算创新型独角兽
2019.01-至今
高级数据库监控工程师监控中台建设标准制定跨团队协作
北京
•负责构建面向多云环境的统一数据库监控中台,引入 ClickHouse 存储监控时序数据,结合 Kafka 流处理,对上千个数据库实例的指标进行实时聚合与异常检测。通过自研的基线偏离算法,提前发现数据倾斜、磁盘 I/O 风暴等隐性风险,将故障发现时间从分钟级缩短至秒级。
•主导编写《数据库监控配置规范》与《告警响应手册》,建立分级告警与自动处理机制。牵头组织内部技术沙龙,分享“监控即代码”理念,推动团队使用 PromQL 和 Python 脚本实现监控策略的版本化管理。同时搭建了 Confluence 知识库,沉淀典型故障复盘与排查 SOP,提升团队整体排障效率。
•与业务中台团队深度协作,在用户增长系统上线前介入数据库设计评审,从监控视角提出分库分表建议,并定制衍生指标采集方案。系统上线后,通过对慢查询和长事务的持续监控,使数据库资源利用率保持在 60% 以下的健康水位,支撑了日均百万级新增用户。
•为支撑大促期间的数据库稳定性,使用 Python + Flask 开发了一套智能巡检系统,集成 Prometheus 数据源,定时扫描所有数据库实例的核心指标,自动生成巡检报告并邮件推送。通过设计启发式规则,可自动识别未提交事务堆积、表空间暴涨等异常,比人工巡检效率提升 80%。在系统设计中,采用 Redis 缓存巡检结果,避免重复查询监控源,并利用 Celery 异步任务实现多实例并发探测,使单次全量巡检时间从 30 分钟压缩至 5 分钟。该系统上线后成功预警了双十一凌晨的缓存穿透引发的数据库连接数飙升,为后续限流措施争取了时间。
•参与公司业务从单体 MySQL 向 TiDB 分布式数据库迁移的监控体系重构。引入 Blackbox Exporter 进行服务探测,并定制 Grafana 面板展示 TiKV 区域分布、调度延迟、Raft 同步状态等组件的细粒度指标。为应对分布式环境下的调用链追踪,集成了 OpenTelemetry 采集器,将数据库请求的 Trace 信息与监控指标关联,实现从应用层到数据库的端到端可视化。项目实施后,分布式事务的故障定位时间平均缩短 60%,并建立了基于节点健康评分的自动摘流规则,有效提升了系统自愈能力。
对数据库的稳定与性能有近乎偏执的关注,习惯从监控曲线的微小波动中嗅出隐患,并提前干预。具备冷静清晰的故障排查思维,能在高压下快速收敛根因,而非表面治标。在性能调优、监控体系建设上积累了扎实的实操手感,善于用脚本和工具链把重复判断交给机器,让人聚焦更复杂的决策。乐于沉淀文档、推动知识共享,与开发、运维团队协作时能自然对齐目标。持续关注可观测性、智能告警等方向,希望把对数据的敬畏转化为更可靠的在线服务守护。
数据库监控平台(Prometheus/Grafana) SQL 调优与审核实践:
通过对慢查询日志的深度分析,发现某业务接口因 OR 条件导致全表扫描,将其改写为 UNION 并创建复合索引,查询耗时从 8 秒下降至 0.5 秒;同时推动上线 SQL 审核流程,利用自动化工具检测潜在风险,已拦截 20+ 次高危变更。
高可用架构与容灾演练:
熟悉 MySQL Group Replication 与 ProxySQL 读写分离架构,能够基于监控设置主从延迟、节点故障告警。在一次网络分区导致主库不可达的故障中,通过切换到备用节点并在 3 分钟内恢复服务,确保零数据丢失,事后总结并优化了切换策略。