•发起校内数据库性能挑战赛,带领团队基于PostgreSQL进行TPC-C基准测试调优,通过索引优化和参数调整使吞吐量提升40%,并沉淀出《数据库性能调优实战手册》供社团内部使用。
•完成《基于Raft的分布式SQL引擎》课程设计,实现简单的查询优化器与分布式事务支持;在实验室助教期间维护TiDB集群,编写Python自动化监控脚本,快速定位并解决多次Region热点问题。
华为技术有限公司 - 云核心网产品线全球ICT巨头技术驱动
2015.07-2019.12
•主导公司全球物流订单系统的数据库运维,针对高峰期QPS暴涨问题,通过分库分表与读写分离改造,将核心接口响应时间从200ms降至50ms以内,支撑了双十一期间日均2亿订单的零故障运转。
•重构商品库存数据库模型,将原本耦合的SKU表拆分为流水表与快照表,在保证库存扣减一致性的前提下,使数据写入吞吐量提升3倍,消除了业务端因锁等待导致的超卖风险。
•建立全链路数据库监控体系,自研慢查询自动采集与可视化看板,推行“事前预防+事中熔断+事后复盘”的SQL治理机制,半年内将线上慢查询数量减少85%。
北京字节跳动科技有限公司 - 数据平台部互联网头部快速增长
2020.01-至今
•带领5人DBA团队承接公司支付清算系统的数据库建设,主导技术选型对比PostgreSQL与TiDB,最终落地分布式数据库方案,使系统轻松支撑每秒5万笔交易,且跨机房数据零丢失。
•构建数据安全防御体系,从网络隔离、传输加密、存储加密到审计日志全覆盖,并设计数据脱敏策略满足GDPR合规要求,带领团队通过两次外部安全审计,零高风险项。
•与财务、风控部门深度协作,将复杂的多维报表需求转化为物化视图与流式预计算方案,将日报生成时间从30分钟压缩至秒级,业务人员对数据及时性的满意度提升至98%。
•负责为千万级DAU的短视频App构建推荐系统的特征存储层,选型采用Redis Cluster + HBase混合架构,分别承载用户实时行为与离线画像,确保推荐请求在100ms内返回。
•设计冷热数据分离策略,将7天内的特征数据保留在Redis中,历史数据下沉至HBase,在保证推荐效果的同时,将整体存储成本降低35%。
•实现数据同步双写方案,并引入布隆过滤器防止缓存穿透,在系统上线后经受住春节流量洪峰,特征查询服务可用性达到99.99%。
•与算法工程师配合,将特征刷新频率从天级提升至分钟级,使推荐模型迭代效率提升了一倍,用户人均观看时长增加8%。
•参与某商业银行信贷审批系统的数据库建设,负责数据库的设计与性能优化,该系统需在5秒内完成对个人用户的信用评估。
•对核心审批流程涉及的50余条SQL进行逐条分析,通过添加复合索引、改写子查询为JOIN、使用CTE等方式,将平均审批时间从2.8秒缩短至1.1秒,性能提升60%。
•制定数据库监控与告警策略,重点监控主从延迟、死锁、连接数等指标,并编写自动化巡检脚本,在项目运行期间成功预警了3次潜在故障,保障了业务零中断。
•与数据建模团队合作,输出信贷数据仓库的星型模型设计,将审批事后分析报表的查询耗时从数小时降至分钟级,为管理层决策提供了高效的数据支持。
数据库自动化运维与工具开发:
擅长使用Go开发数据库管理工具,曾编写基于etcd的配置中心实现数据库集群的动态扩缩容,并搭建全链路监控告警平台,通过Prometheus与Grafana监控MySQL、Redis核心指标,自动触发故障恢复流程,将平均修复时间从30分钟缩短至5分钟。