负责公司云原生平台(K8s多集群、Serverless)全生命周期运维,保障跨北京、上海、广州三地业务高可用,推动运维向自动化、智能化转型,支撑AI训练、实时音视频等新兴业务上云。
- 主导云原生平台升级,基于KubeSphere搭建多集群管理系统,集成Istio服务网格实现跨AZ流量智能调度,Q2某数据中心断电故障时,业务流量30秒内切换至备用集群,全年核心业务中断时长累计小于5分钟。
- 设计混沌工程验证体系,使用Chaos Mesh在预发布环境注入网络延迟(500ms)、节点宕机(随机销毁30% Pod)等故障场景,发现Service Mesh路由规则缺陷并修复,关键服务容错能力(错误恢复率)从65%提升至95%。
- 解决Serverless函数冷启动瓶颈,通过预置暖实例(提前30分钟加载高频函数)、资源预热策略(定时触发空请求),将平均冷启动时间从800ms降至200ms,支撑日活1000万+的直播弹幕推送服务零超时。
- 落地AIOps智能运维,基于ELK+Prometheus的历史故障数据训练XGBoost异常检测模型,实现90%以上常见故障(如磁盘满、网络丢包)自动诊断并推送修复建议,运维人力投入减少30%,故障平均处理时长缩短至8分钟。