•带领团队完成《数据库系统实现》课程大作业,从零研发支持MVCC与故障恢复的分布式KV存储,吞吐量超越课程基准300%,获评年度最佳项目。
•作为队长参加“全国大学生数据库性能优化挑战赛”,针对百GB级TPC-H负载设计索引与查询改写策略,以最小资源消耗将5条慢SQL提升至亚秒级,获华北赛区冠军。
•发起“数据库内核研究小组”,组织20余人每周阅读PostgreSQL优化器源码,并面向全校举办3场技术讲座,推动成立校内数据库技术社群。
腾讯科技(深圳)有限公司 - 数据平台部社交与内容巨头技术领先
2014.01-2019.12
数据库管理技术总监分布式架构演进高可用架构设计数据治理
北京
•主导公司社交平台数据库从烟囱式部署向分布式架构的全面转型,设计千万级QPS的读写分离与分库分表方案,并引入一致性哈希分流策略,使系统峰值响应时间缩短45%,平稳抗住了历次春节红包流量洪峰。
•构建全链路数据安全防护体系,从传输层、存储层到访问层部署动态脱敏、审计追踪与异常行为检测,推动数据分类分级管理,通过ISO 27001认证,确保数亿用户隐私绝对合规。
•推动数据库变更流程的自动化与标准化,自研DDL/DML审核发布平台,与研发团队深度协作,实现数据库容量规划、索引优化建议的自动输出,支撑核心业务日活从亿级到十亿级的平滑增长。
京东科技控股股份有限公司 - 基础技术部自营电商巨头技术驱动
2009.07-2013.12
高级数据库管理员数据库运维标准化智能监控灾备演练
北京
•负责电商核心数据库集群的自动化运维保障,引入全量/增量混合备份的自动化验证与恢复演练机制,将数据恢复RTO从小时级压缩至分钟级,并输出标准化运维手册,大幅降低新人上手成本。
•主导双十一、618大促前的数据库容量评估与智能扩容,通过自研压测平台提前发现热点瓶颈,针对性地进行缓存层与数据库的协同优化,保障大促期间数据库零故障、零资损。
•建立多维度监控指标体系,融合日志、慢查询、主机指标,开发智能根因分析引擎,实现70%常规故障的自愈处理,全年数据库服务可用性达到99.995%。
社交平台核心数据库同城双活架构改造 - 项目负责人
2017.01-2017.12
•针对社交业务写多读少、高并发推送的特性,设计同城双数据中心数据同步架构,创新采用基于binlog的异步复制与消息队列解耦方案,解决数据延迟与冲突难题。
•带领团队自主研发数据校验与自动切换工具,实现双活流量调度与故障切换时间均在30秒以内,并成功通过多次模拟突发断网演练。
•项目上线后,系统整体吞吐量提升80%,数据强一致性区域内的用户体验得到显著改善,成功承载了随后春节红包活动的峰值流量,为公司节省了上千万的硬件扩容成本。
实时数据仓库OLAP引擎选型与建设 - 技术负责人
2011.01-2012.12
•为支撑实时业务报表和用户画像分析,主导ClickHouse列式数据库集群的部署与深度优化,设计冷热数据分层存储策略,极大降低存储成本。
•与数据分析团队紧密合作,重构多表join查询,通过物化视图与位图索引优化,将百万级广告效果数据查询延迟从分钟级降至秒级,使运营决策效率提升5倍。
•开发自动化数据同步管道,实现离线批量数据与实时流式数据的无缝融合,建立集群的自动扩展机制,保障了平台在6·18大促期间数据宽表的稳定产出。
高可用架构与容灾韧性体系:
主导引入基于Paxos的多副本强一致分布式数据库,构建同城双活、异地灾备的立体化高可用布局,实现任意单机房故障业务无感切换。
设计多层级故障探测与自动切换决策树,结合负载感知的健康评分机制,将切换时间从分钟级压缩至10秒内,并消除误切风险。
通过混沌工程平台常态化注入网络分区、磁盘故障等复杂异常,连续3年完成红蓝对抗演练,确保极端场景下RPO=0、RTO<30秒,全年无数据丢失事件。