负责智慧城市信息系统全生命周期运维,涵盖政务云平台、物联网感知设备及民生应用系统的监控告警、故障根因定位、自动化流程搭建及跨部门协同,目标保障核心系统可用率≥99.9%,支撑政务服务‘一网通办’、智慧交通调度等业务连续性。
- 主导构建‘多源融合智能监控体系’:基于Prometheus+Grafana搭建统一监控平台,整合政务云服务器、路侧物联网传感器、社区政务终端等12类设备数据,针对传统监控中‘物联网设备协议不兼容’痛点,开发Modbus/LoRa数据适配器,实现98%关键指标实时采集;优化告警规则引擎,通过机器学习识别异常波动阈值,故障发现时效从45分钟缩短至12分钟,年度系统宕机时长同比减少65%。
- 牵头核心业务系统容灾能力升级:针对‘市民服务平台’高并发特性,设计‘两地三中心’容灾方案,每月模拟断网、数据库主节点宕机等10+类故障场景;发现MySQL主从复制延迟问题后,通过调整binlog格式为ROW并引入Redis缓存热点数据,将RTO(恢复时间目标)从2小时压缩至25分钟,RPO(恢复点目标)从15分钟降至5分钟,全年未发生影响用户超10分钟的服务中断。
- 推动自动化运维工具链开发:梳理日常巡检、补丁分发、日志归档等8类重复性任务,基于Python+Ansible开发‘智维助手’脚本库,实现服务器配置批量校验(准确率99.9%)、安全补丁自动分发(覆盖率100%);单节点部署时间从30分钟降至5分钟,年度节省人工操作耗时约200人天,相关工具被纳入公司运维标准库。
- 优化跨部门运维协作流程:联合开发、安全、业务部门制定《智慧城市系统运维SLA2.0》,明确故障工单分级响应标准(P1级故障15分钟内到场)、变更窗口期规范;建立‘运维-开发’缺陷闭环机制,通过Jira跟踪代码部署引发的系统异常,推动开发侧修复高频BUG 37个,工单处理及时率从88%提升至96%,部门间推诿问题减少60%。