188****3548niu****@***.com北京35男数据库高可用架构师在职北京30k-50k •系统钻研了数据库系统实现、分布式存储、并行计算等核心课程,并辅修了智能运维与时间序列分析,构建了纵贯底层与数据驱动的知识体系。
•组队参加全国大学生数据库大赛,设计并实现了一个支持多副本强一致的小型分布式KV存储引擎,通过Raft协议与日志压缩优化,获得华东赛区金奖,锤炼了分布式系统设计与调试能力。
•加入校学生技术协会的基础架构组,参与重构校园健康打卡平台的数据层,主导MySQL分库分表方案设计与基于ProxySQL的读写分离落地,将QPS上限提升了3倍。
•利用暑期在先进数据库实验室实习,参与评测一款开源图数据库在不同负载下的恢复能力,通过设计混沌测试场景分析WAL策略与快照频率对RTO的影响,形成对高可用容错机制的实践认知。
北京字节跳动科技有限公司 - 基础架构部互联网大厂技术驱动
2014.07-2019.12
数据库高可用架构师高可用架构数据库集群性能调优
北京
•主导公司核心业务线数据库高可用架构的演进,针对电商交易、供应链等场景,设计多活容灾方案,保障峰值百万QPS下的数据零丢失。
•搭建并优化MySQL集群,引入ProxySQL与Orchestrator实现读写分离与自动故障转移,将主从切换时间控制在10秒以内,全年可用性达到99.995%。
•制定并推行数据生命周期管理策略,设计冷热数据分离方案,结合归档与定期清理,降低存储成本约40%的同时保持查询性能稳定。
•深入参与业务模型设计,为开发团队提供SQL审核与索引优化建议,累计优化慢查询300余条,将核心接口平均响应时间从200ms降至80ms。
•构建全链路监控体系,基于Prometheus与Grafana定制数据库健康度大盘,联动告警规则实现故障提前预警,平均故障发现时间缩短60%。
北京小米移动软件有限公司 - 数据库技术部互联网巨头创新能力强
2020.01-至今
数据库高可用架构师平台研发分布式一致性智能调度
北京
•负责新一代数据库高可用平台的架构设计与核心模块研发,平台采用Service Mesh思路,实现数据库代理层的无侵入接入,支撑微服务架构下的透明切换。
•重构数据复制通道,设计基于Raft的强一致性复制协议,并优化网络压缩策略,将跨机房数据同步延迟从秒级降低至毫秒级,大幅提升异地多活场景下的数据新鲜度。
•开发数据库资源调度引擎,根据实例负载与业务优先级自动弹性伸缩,使数据库资源池的CPU平均利用率从30%提升至65%,有效节约硬件成本。
•编写《数据库高可用设计规范》与《变更管理白皮书》,组织跨部门技术培训,推动所有新业务接入高可用框架,降低人为操作风险。
•与SRE团队共建混沌工程体系,定期对数据库系统进行故障注入演练,验证自动切换与数据修复能力,持续提升系统的韧性。
•该项目为国内头部在线教育平台提供数据库架构升级,其业务特点是晚高峰流量突增、直播课对延迟极度敏感,要求数据库在瞬时30万QPS下保持稳定。
•设计了一套基于Vitess的分布式数据库方案,将用户数据按师生关系分片,配合读写分离与连接池管理,使整体吞吐量提升4倍,直播课卡顿率下降至0.1%以下。
•实现跨可用区自动容灾,通过GTID与半同步复制确保数据一致性,并自研状态检测服务,在机房级故障时30秒内完成流量切换,保障线上教学不中断。
•针对慢查询进行专项治理,联合业务方重构核心查询,利用覆盖索引与汇总表将报表生成时间从分钟级优化至秒级,大幅提升教学管理后台体验。
•项目交付后,平台成功支撑了寒假百万级并发上课,数据库全年可用性达到99.99%,成为公司内部高可用改造的标杆案例。
•该项目服务于某大型物联网设备管理平台,需要处理海量设备心跳、时序数据写入,且要求数据不丢失、查询延迟低,对数据库的水平扩展能力提出极高要求。
•引入TiDB分布式数据库,构建多Raft组的多活架构,将设备信息按产品线分区,实现写入与查询的线性扩展,轻松应对日均10亿条时序数据的写入。
•设计基于Change Data Capture的实时数据同步管道,将设备最新状态推送至下游分析系统,延迟控制在2秒以内,支撑了设备故障的实时报警。
•制定全量+增量结合的备份策略,并搭建异地灾备集群,通过定期演练验证RPO<30秒、RTO<5分钟,确保了极端情况下数据的安全性与业务连续性。
•方案上线后,该物联网平台的数据可靠性和查询性能得到客户高度认可,成功支撑了千万级设备接入,交易成功率保持在99.999%以上。
对数据库高可用与数据可靠性抱有近乎偏执的追求,习惯从故障演练中反推架构脆弱点,把每一次容灾切换都当作对职业敬畏的验证。做事严谨、抗压且自驱,面对复杂业务峰值压力能保持冷静,持续推进多活、异地多中心等方案落地。具备从内核原理到分布式共识协议的深度积累,擅长将高可用目标拆解为可落地的策略与自动化运营体系,对造成中断的风险点近乎零容忍。持续跟踪混沌工程、智能运维等前沿实践,希望在数据库架构师岗位上将稳定性打磨成一种可量化的工程能力,而不仅是口号。
数据库混沌工程与故障演练:
持续关注数据库韧性工程,独立搭建了一套基于Ansible与自定义故障注入脚本的混沌演练平台,可编排网络丢包、节点重启、磁盘漫游等故障场景,自动抓取切换耗时与数据一致性验证结果,将集群的年度意外停机时间压缩了65%。