负责公司核心交易、用户行为、日志三大类数据库集群的全生命周期管理,主导分布式数据库架构升级与自动化运维体系搭建,统筹跨部门数据库技术协作,保障日均10亿+请求、PB级数据量的数据库集群稳定性与成本效率。
- 主导完成MySQL向TiDB的分布式架构迁移项目:针对电商大促期间单库QPS突破8万导致的性能瓶颈,通过分析sysbench压测报告与慢查询日志(使用pt-query-digest定位TOP 100慢SQL),设计分库分表策略并重构应用连接池逻辑,迁移过程采用TiDB Lightning离线导入+增量Binlog同步方案,实现零数据丢失;迁移后集群读写QPS峰值提升至15万,存储成本降低40%,大促期间故障率从0.8%降至0.1%。
- 构建数据库自动化运维平台:基于Python开发部署脚本(集成Ansible Tower),实现从实例创建、参数配置、备份恢复到监控告警的全流程自动化;对接Prometheus+Grafana监控体系,自定义30+核心指标(如InnoDB Buffer Pool命中率、锁等待时长),结合机器学习算法预测容量峰值,提前72小时触发扩容提醒,全年避免因资源不足导致的业务中断事件12起。
- 优化多活容灾架构:针对华东-华南双数据中心同步延迟问题(原平均50ms),通过调整TiKV Region分裂策略与Raft Group副本分布,结合Zabbix自定义告警规则(设置延迟阈值30ms触发熔断),将同步延迟稳定控制在10ms以内;主导完成两地三中心容灾演练,RTO从2小时缩短至15分钟,RPO从5分钟降至30秒,通过信通院数据库容灾能力四级认证。
- 制定数据库开发规范与培训体系:梳理《慢查询优化手册》《索引设计指南》等6份技术文档,组织跨部门技术培训20场,推动业务侧SQL写合规率从65%提升至92%;建立SQL审核平台(集成Yearning),拦截高危操作(如无索引全表扫描、大事务)占比从35%降至8%,年减少生产环境故障30+次。