点击保存简历
模块
风格
模板
导入
  • 个人名称
  • 头像
  • 基本信息
  • 求职意向
  • 工作经历
  • 项目经验
  • 实习经验
  • 作品展示
  • 奖项荣誉
  • 校园经历
  • 教育背景
  • 兴趣爱好
  • 技能特长
  • 语言能力
  • 自我评价
  • 报考信息
  • 简历封面
  • 自荐信
陆明哲
责任心不是口号,而是渗透在每个工作细节中的行动准则。
28岁
3年工作经验
13800138000
DB@zjengine.com
陆明哲的照片
求职意向
云平台运维工程师
北京
薪资面谈
到岗时间另议
工作经历
2023.07 - 2025.06
小楷智云
云平台运维工程师

负责公司公有云(阿里云、腾讯云)与私有云(OpenStack)混合架构全生命周期运维,主导自动化运维体系搭建、容量规划及99.99% SLA保障,支撑电商大促、金融交易等核心业务稳定运行。

  • 主导设计混合云资源管理平台,基于Terraform实现IaC(基础设施即代码)标准化,结合Ansible完成2000+云资源(ECS、CLB、RDS)的自动化编排与配置校验,解决多环境(开发/测试/生产)配置漂移问题,资源交付周期从48小时压缩至2小时,资源利用率从42%提升至77%(通过云厂商账单分析与资源水位监控验证)。
  • 搭建Prometheus+Grafana全链路监控体系,集成云厂商API、Kubernetes Metrics Server及自定义业务指标(如订单成功率、支付耗时),设计分级告警规则(P0-P4)并对接企业微信/电话告警,Q2季度故障定位时间从25分钟缩短至8分钟,全年因云平台问题导致的P0级故障次数同比下降60%(对比2023年同期数据)。
  • 推动Kubernetes集群性能优化,针对双11流量峰值(较日常5倍)场景,调整调度策略(引入节点亲和性、污点容忍度)并启用Cluster Autoscaler动态扩缩容,配合HPA基于QPS自动调整Pod副本数,集群CPU平均利用率从35%提升至68%,支撑单日1.2亿订单交易无超时报错,稳定性达99.995%。
  • 牵头容量规划项目,通过分析近12个月业务增长曲线(DAU月均增15%)与云资源消耗模型,预测2024年Q4需扩容300台ECS实例及50TB块存储,提前协调云厂商预留资源并优化采购策略(混合使用按需实例与抢占式实例),较原预算节省28%(约450万元)。
2021.08 - 2023.06
小楷互联
高级云平台运维工程师

负责公司核心业务云平台(AWS、华为云)高可用架构设计与运维,主导跨云容灾方案落地及年度成本优化,保障金融级业务99.99%可用性与成本可控。

  • 主导AWS中国区向华为云迁移项目,采用CloudEndure实现200+业务实例(含MySQL、Redis)的增量同步,结合自定义Python脚本完成网络配置(VPC peering、安全组规则)迁移,迁移窗口期业务中断时间控制在15分钟内,迁移后资源成本降低22%(月均节省120万元),SLA从99.9%提升至99.95%(通过第三方拨测验证)。
  • 构建FinOps成本管控体系,基于AWS Cost Explorer与自研账单分析工具(Go语言开发),识别冗余EC2实例(占比18%)与S3冷数据(占比30%),推动开发团队优化Docker镜像(平均体积从2GB缩减至1.2GB)及调整存储类型(高频数据转低频访问),年度云成本节省180万元,成本优化率15%(写入公司年度降本报告)。
  • 优化云安全防护体系,部署阿里云WAF+威胁情报平台,定制120条安全规则拦截SQL注入、XSS攻击,结合云防火墙封禁恶意IP段(日均阻断攻击尝试5万+次),全年未发生因云安全漏洞导致的业务中断,安全事件数量同比下降75%(对比2021年)。
  • 设计跨云容灾方案,通过华为云DRS实现MySQL主从实时同步,定期执行故障切换演练(季度级),验证RPO≤5分钟、RTO≤30分钟,满足金融行业监管要求(通过等保三级测评)。
2019.07 - 2021.07
小楷在线
云平台运维工程师

负责公司初期云平台(阿里云)基础运维,保障测试/生产环境稳定,参与自动化工具链搭建,支撑电商业务从0到1落地。

  • 搭建阿里云ECS+RDS+OSS基础架构,编写Shell脚本实现每日数据库全量+增量备份(保留7天)及OSS日志自动转冷(30天后转归档存储),全年数据丢失风险为0,存储成本降低30%(对比人工管理时期)。
  • 推动测试环境容器化改造,基于Docker Compose+Jenkins实现测试环境快速创建(4小时内完成从0到N套环境部署),替代传统虚拟机(单环境创建需1天),团队研发迭代效率提升25%(PMO统计)。
  • 建立云平台操作规范,制定《云资源申请审批SOP》(含资源命名、标签规范)与《云故障应急手册》(覆盖ECS宕机、RDS主备切换等场景),组织季度应急演练,人为操作失误导致的故障次数从每月3次降至0.5次以内。
  • 优化日志分析流程,部署ELK Stack(Elasticsearch+Logstash+Kibana)收集应用日志与云审计日志,通过Kibana仪表盘监控接口错误率(目标<0.1%),Q4季度接口异常发现时效从2小时缩短至5分钟,助力业务故障修复效率提升40%。
项目经验
2022.03 - 2023.10
星途互娱(专注互联网文娱场景的直播与互动内容平台)
运维开发负责人

星途直播平台全链路可观测体系重构与智能化升级项目

  • 星途直播作为公司核心业务,承载1.2亿月活用户,原可观测体系存在“分散化”痛点——Metrics用Prometheus但无统一规范、Logs依赖ELK检索慢、Traces未打通跨服务链路,导致故障MTTR平均12分钟,严重影响用户体验。我的核心目标是主导重构覆盖Metrics、Logs、Traces的全链路可观测体系,将MTTR降低至5分钟内,同时支撑业务快速排查问题。
  • 项目遇到三大关键挑战:1)跨50+微服务的链路追踪一致性差,TraceID传递无统一协议导致链路断裂;2)高Cardinality指标(如用户ID、直播间ID)导致Prometheus存储成本月均增长25%;3)Logs与Traces/Metrics无关联,排查时需手动匹配多系统数据,效率极低。我选择基于OpenTelemetry构建统一观测底座,用Thanos解决长期存储与查询性能,用Loki替代ELK实现日志标签化索引。
  • 我的核心行动包括:1)牵头成立“可观测专项组”,联合研发、产品制定《OpenTelemetry接入规范》,改造12个核心服务SDK,强制注入TraceID并打通跨系统传递,解决链路断裂问题;2)设计“指标分层体系”——将指标分为基础资源、服务性能、业务转化三层,对高基数指标采用“哈希降维+定期聚合”策略,配合Thanos压缩存储,将Prometheus存储成本降低40%;3)整合Grafana搭建“故障排查一站式Dashboard”,联动Traces拓扑、Metrics趋势、带TraceID的Logs详情,实现“点击链路节点即可看关联日志与指标”。
  • 项目成果显著:1)MTTR从12分钟降至2分40秒,故障定位效率提升76%;2)可观测覆盖度从60%提升至95%,所有核心服务、数据库、中间件均纳入监控;3)存储成本年降约35万元,同时支撑了“暑期直播节”等大型活动0级故障;4)业务侧直播卡顿率下降15%——通过可观测体系快速定位到转码服务CPU瓶颈,优化集群资源分配后支撑了单直播间100万并发观看。我个人也沉淀了《互联网直播场景可观测体系设计手册》,成为公司后续项目的参考标准。
2020.07 - 2022.02
星途互娱
运维开发工程师

星途直播弹幕系统高可用改造与弹性伸缩优化项目

  • 星途直播弹幕系统承担着每场直播的实时互动需求,但在“年度盛典”“热门剧综直播”等场景下,常因并发量突增(峰值超10万QPS)出现延迟、节点宕机,导致用户互动率下降20%。我的目标是重构弹幕系统的高可用架构,实现“弹性伸缩+零感知扩容”,支撑百万级并发弹幕。
  • 项目难点在于:1)弹幕服务虽无状态,但依赖用户在线状态服务(同步延迟达30秒),扩容时需等待状态同步,导致新节点无法立即承载流量;2)传统轮询负载均衡策略导致热点直播间节点压力过大,常触发熔断;3)K8s HPA的默认伸缩指标(CPU利用率)不准确,要么过度扩容浪费资源,要么扩容不及时导致故障。
  • 我的解决路径:1)主导“状态剥离”改造——将用户在线状态从弹幕服务迁移至Redis Cluster,实现服务无状态化,扩容时仅需增加节点无需同步状态;2)改用Nginx Plus的“一致性哈希负载均衡”,基于直播间ID哈希分配请求,减少热点节点的压力;3)开发“自定义Metrics Adapter”——将“弹幕发送速率”“消息队列长度”等复合指标暴露给K8s HPA,实现“基于业务场景的精准伸缩”。
  • 项目落地后效果明显:1)弹幕系统QPS从5万提升至20万,并发能力增长300%;2)扩容响应时间从5分钟缩短至1分钟,支撑了“年度盛典”直播的120万并发弹幕;3)弹幕延迟从2秒降至500毫秒以内,用户互动率提升22%;4)资源利用率提升35%——精准伸缩避免了30%的闲置节点成本。这个项目让我从“被动运维”转向“主动设计高可用架构”,也积累了处理“无状态服务状态依赖”的关键经验。
技能特长
沟通能力
执行能力
热情坦诚
文案能力
奖项荣誉
  • 信息系统运维管理工程师(中级)
  • 2022年度公司项目攻坚奖
  • 2023年度部门优秀技术员工
自我评价
  • 深耕互联网云运维6年,打通架构部署到容量管理全链路,习惯以业务峰值场景锚定平台韧性,前置规避大促级稳定性风险。
  • 故障处理坚持“根因-闭环-沉淀”,用自动化框架压MTTR至10分钟内,更推动团队建案例库降重复问题30%。
  • 对云成本敏感,能结合业务流量配弹性策略,帮前司年省18%且不影响体验。
  • 跨团队偏好“业务语言对齐”,把云价值转成产品、运营支撑点,让技术更贴业务目标。
智能诊断
编写灵感
请选择需要查找的灵感类型
请选择灵感源泉
选择合适的内容插入后即可编辑调整
请在上方选择您需要获取的灵感类型
对话框
提示
说明