点击保存简历
模块
风格
模板
导入
  • 个人名称
  • 头像
  • 基本信息
  • 求职意向
  • 工作经历
  • 项目经验
  • 实习经验
  • 作品展示
  • 奖项荣誉
  • 校园经历
  • 教育背景
  • 兴趣爱好
  • 技能特长
  • 语言能力
  • 自我评价
  • 报考信息
  • 简历封面
  • 自荐信
陆明哲的照片
陆明哲
用系统化的思维解决问题,用温度化的方式交付成果,这是我的工作准则。
28岁
3年工作经验
13800138000
DB@zjengine.com
求职意向
云平台运维工程师
北京
薪资面谈
三个月内到岗
工作经历
2023.07 - 2025.06
小楷智云
云平台运维工程师

负责公司公有云(阿里云、腾讯云)与私有云(OpenStack)混合架构全生命周期运维,主导自动化运维体系搭建、容量规划及99.99% SLA保障,支撑电商大促、金融交易等核心业务稳定运行。

  • 主导设计混合云资源管理平台,基于Terraform实现IaC(基础设施即代码)标准化,结合Ansible完成2000+云资源(ECS、CLB、RDS)的自动化编排与配置校验,解决多环境(开发/测试/生产)配置漂移问题,资源交付周期从48小时压缩至2小时,资源利用率从42%提升至77%(通过云厂商账单分析与资源水位监控验证)。
  • 搭建Prometheus+Grafana全链路监控体系,集成云厂商API、Kubernetes Metrics Server及自定义业务指标(如订单成功率、支付耗时),设计分级告警规则(P0-P4)并对接企业微信/电话告警,Q2季度故障定位时间从25分钟缩短至8分钟,全年因云平台问题导致的P0级故障次数同比下降60%(对比2023年同期数据)。
  • 推动Kubernetes集群性能优化,针对双11流量峰值(较日常5倍)场景,调整调度策略(引入节点亲和性、污点容忍度)并启用Cluster Autoscaler动态扩缩容,配合HPA基于QPS自动调整Pod副本数,集群CPU平均利用率从35%提升至68%,支撑单日1.2亿订单交易无超时报错,稳定性达99.995%。
  • 牵头容量规划项目,通过分析近12个月业务增长曲线(DAU月均增15%)与云资源消耗模型,预测2024年Q4需扩容300台ECS实例及50TB块存储,提前协调云厂商预留资源并优化采购策略(混合使用按需实例与抢占式实例),较原预算节省28%(约450万元)。
2021.08 - 2023.06
小楷互联
高级云平台运维工程师

负责公司核心业务云平台(AWS、华为云)高可用架构设计与运维,主导跨云容灾方案落地及年度成本优化,保障金融级业务99.99%可用性与成本可控。

  • 主导AWS中国区向华为云迁移项目,采用CloudEndure实现200+业务实例(含MySQL、Redis)的增量同步,结合自定义Python脚本完成网络配置(VPC peering、安全组规则)迁移,迁移窗口期业务中断时间控制在15分钟内,迁移后资源成本降低22%(月均节省120万元),SLA从99.9%提升至99.95%(通过第三方拨测验证)。
  • 构建FinOps成本管控体系,基于AWS Cost Explorer与自研账单分析工具(Go语言开发),识别冗余EC2实例(占比18%)与S3冷数据(占比30%),推动开发团队优化Docker镜像(平均体积从2GB缩减至1.2GB)及调整存储类型(高频数据转低频访问),年度云成本节省180万元,成本优化率15%(写入公司年度降本报告)。
  • 优化云安全防护体系,部署阿里云WAF+威胁情报平台,定制120条安全规则拦截SQL注入、XSS攻击,结合云防火墙封禁恶意IP段(日均阻断攻击尝试5万+次),全年未发生因云安全漏洞导致的业务中断,安全事件数量同比下降75%(对比2021年)。
  • 设计跨云容灾方案,通过华为云DRS实现MySQL主从实时同步,定期执行故障切换演练(季度级),验证RPO≤5分钟、RTO≤30分钟,满足金融行业监管要求(通过等保三级测评)。
2019.07 - 2021.07
小楷在线
云平台运维工程师

负责公司初期云平台(阿里云)基础运维,保障测试/生产环境稳定,参与自动化工具链搭建,支撑电商业务从0到1落地。

  • 搭建阿里云ECS+RDS+OSS基础架构,编写Shell脚本实现每日数据库全量+增量备份(保留7天)及OSS日志自动转冷(30天后转归档存储),全年数据丢失风险为0,存储成本降低30%(对比人工管理时期)。
  • 推动测试环境容器化改造,基于Docker Compose+Jenkins实现测试环境快速创建(4小时内完成从0到N套环境部署),替代传统虚拟机(单环境创建需1天),团队研发迭代效率提升25%(PMO统计)。
  • 建立云平台操作规范,制定《云资源申请审批SOP》(含资源命名、标签规范)与《云故障应急手册》(覆盖ECS宕机、RDS主备切换等场景),组织季度应急演练,人为操作失误导致的故障次数从每月3次降至0.5次以内。
  • 优化日志分析流程,部署ELK Stack(Elasticsearch+Logstash+Kibana)收集应用日志与云审计日志,通过Kibana仪表盘监控接口错误率(目标<0.1%),Q4季度接口异常发现时效从2小时缩短至5分钟,助力业务故障修复效率提升40%。
项目经验
2022.05 - 2023.10
星途互娱
运维开发负责人

文娱业务低延迟高可用运维平台研发及规模化落地

  • 项目背景:公司文娱业务(直播、长视频、会员系统)用户量年增长40%,现有运维体系存在工具碎片化(分散的监控、配置、自动化工具)、故障排查耗时(平均45分钟/次)、资源成本超支(年度服务器成本占比营收18%)等痛点。核心目标是构建统一运维平台,实现“高可用保障、低延迟监控、自动化运维”,支撑业务快速迭代。我作为运维开发负责人,主导平台整体设计、跨团队需求对齐及落地推进。
  • 关键难题与技术方案:a) 多环境配置一致性难——传统手动配置易出错;b) 直播流低延迟监控缺失——传统Prometheus 60秒采集间隔无法满足端到端≤500ms延迟的实时追踪;c) 故障自愈覆盖不足——高频问题(如Pod重启、数据库连接池耗尽)仍需人工干预。针对性方案:采用Terraform+Ansible组合实现配置代码化;自研直播流延迟Exporter,整合CDN日志、应用埋点及网络探针数据,将采集间隔缩短至10秒;基于Python开发20+高频故障自愈剧本,联动告警系统自动修复。
  • 核心行动与创新:牵头组织研发、产品、运营3轮痛点调研,输出《运维痛点清单》及需求文档;设计“配置管理-监控告警-自动化运维-成本分析”微服务架构(Spring Cloud);带领5人团队完成Exporter开发、Terraform模板编写及自愈剧本调试;推动预发环境1个月灰度验证,再逐步推广至生产核心业务。
  • 项目成果与价值:平台上线6个月覆盖80%核心业务,故障排查时间降至8分钟内,自动化率从35%提升至75%;年度服务器成本降低22%(约节省1200万元),支撑“暑期直播季”零重大故障,用户观看延迟降低15%。我个人主导的平台架构获公司“年度技术创新奖”,成为新业务运维标准底座。
2020.08 - 2022.03
星途互娱
运维开发核心成员

短视频核心服务容器化迁移与弹性伸缩体系搭建

  • 项目背景:公司短视频业务爆发(月活从1亿增至3亿),传统虚拟机部署存在资源利用率低(30%)、扩容慢(15分钟/次)、交付周期长(每周2个服务)等问题。核心目标是将feed流、视频上传等核心服务迁移至Kubernetes,构建弹性伸缩体系。我作为运维开发核心成员,负责容器化适配、弹性策略设计及迁移落地。
  • 关键难题与技术方案:a) 老服务(Spring Boot 1.x)依赖本地文件系统及固定IP,迁移后服务发现失败、日志丢失;b) 流量波动大(热点事件QPS暴涨5倍),传统CPU指标HPA无法满足快速扩容;c) 迁移需保障业务连续性。解决方案:用Helm打包服务,定制化NFS解决文件依赖,通过Istio实现服务发现;构建多维度弹性指标(QPS+延迟+错误率+CPU),自定义HPA策略将扩容阈值从“CPU≥70%”调整为“QPS≥1万且延迟≥2秒”;制定“灰度迁移+回滚预案”,开发迁移状态监控面板。
  • 核心行动与创新:对12个核心服务做容器化评估,输出《迁移可行性报告》及“先易后难”路线图;开发自动化工具将虚拟机配置转为K8s YAML,减少人工错误;压测验证伸缩效果,调整指标权重;推动研发优化代码(增加缓存、减少DB连接)提升容器性能。
  • 项目成果与价值:3个月完成12个服务迁移,资源利用率从30%升至65%,扩容时间降至2分钟内;支撑峰值QPS从5万提至20万,无扩容故障;运维人力成本降低40%(原3人部署现1人自动化完成)。该弹性体系成为公司K8s集群标准配置,后续新服务默认采用。
奖项荣誉
  • 信息系统运维管理工程师(中级)
  • 2022年度公司项目攻坚奖
  • 2023年度部门优秀技术员工
技能特长
沟通能力
执行能力
热情坦诚
文案能力
自我评价
  • 深耕互联网云运维7年,聚焦高可用架构与故障根因分析,习惯从业务链路预判云资源瓶颈,把稳定性刻进平台基因。
  • 擅长用云原生工具优化资源利用率,将冗余成本转化为业务迭代空间,始终守牢SLA99.99%的底线。
  • 不被动救火,通过日志与指标趋势建故障预警闭环,让平台“少出问题”成为核心能力。
  • 作为云运维与研产的衔接枢纽,用技术语言翻译业务需求,推动云能力下沉场景,支撑快速上线与弹性扩缩容。
智能诊断
编写灵感
请选择需要查找的灵感类型
请选择灵感源泉
选择合适的内容插入后即可编辑调整
请在上方选择您需要获取的灵感类型
对话框
提示
说明