点击保存简历
模块
风格
模板
导入
  • 个人名称
  • 头像
  • 基本信息
  • 求职意向
  • 工作经历
  • 项目经验
  • 实习经验
  • 作品展示
  • 奖项荣誉
  • 校园经历
  • 教育背景
  • 兴趣爱好
  • 技能特长
  • 语言能力
  • 自我评价
  • 报考信息
  • 简历封面
  • 自荐信
陆明哲
昨天的经验是今天的基石,而今天的突破将成为明天的标准。
28岁
3年工作经验
13800138000
DB@zjengine.com
陆明哲的照片
求职意向
云平台运维工程师
北京
薪资面谈
随时到岗
工作经历
2023.07 - 2025.06
小楷智云科技
云平台运维工程师

主导公司混合云平台(AWS+阿里云+自研私有云)的稳定性建设、成本精细化管控及自动化运维体系迭代,覆盖从基础设施编排到应用层容灾的全链路运维,对核心业务(电商交易、会员系统)的云平台可用性负责

  • 针对核心交易链路跨AWS与阿里云调用延迟高(120ms)的问题,主导使用AWS CloudWatch全链路追踪与阿里云ARMS应用监控联动,结合自研拓扑分析工具定位到跨云VPC peering路由策略不合理导致的丢包,通过调整BGP Anycast节点部署与路由优先级,将跨云延迟降至40ms以内;同步优化云厂商间的 peering 连接带宽(从1Gbps扩容至2Gbps),全年核心链路故障时长从11小时压缩至1.5小时,支撑双11大促期间交易成功率提升至99.98%
  • 牵头梳理全公司云资源 inventory(覆盖AWS EC2/S3/RDS、阿里云ECS/OSS/RDS、私有云OpenStack节点),使用Python开发自动化资源回收脚本(集成AWS Lambda与阿里云函数计算),结合“30天未使用”标签策略,每月自动回收闲置EC2实例(月均15台)、未释放EBS卷(月均8TB)及空闲OSS Bucket(月均3个),年云资源成本降低28%(约120万元)
  • 推动私有云平台自动化能力升级,采用Terraform实现OpenStack节点(计算/存储/网络)的Infrastructure as Code(IaC)编排,将新节点部署时间从4小时缩短至30分钟;引入Argo CD搭建应用配置漂移检测体系,关联GitLab CI/CD pipeline,实现配置变更实时校验与回滚,配置变更成功率从92%提升至99.5%,减少因配置错误导致的业务中断事件80%
  • 设计跨云双活容灾架构(AWS北京 region + 阿里云杭州 region),针对核心MySQL数据库采用AWS DMS与阿里云DTS实现双向数据同步(延迟<1秒),结合自研故障切换脚本(基于Shell+API调用),实现RTO<3分钟、RPO<10秒;通过年度灾备演练(模拟AWS北京region电源中断),验证容灾切换流程有效性,满足金融级容灾合规要求
2021.08 - 2023.06
小楷互联科技
云运维工程师

负责公司AWS云平台(us-west-2、cn-north-1 region)日常运维,涵盖EC2、S3、RDS、CloudFront的全生命周期管理,支撑电商主营业务的大促活动与常态化运营

  • 为应对618大促流量峰值(预测12万QPS),使用AWS Auto Scaling Group结合CloudFormation模板实现EC2实例弹性扩容,基于过去3年大促流量趋势优化扩缩容策略(提前30分钟启动预热实例),大促期间支撑峰值QPS 13.2万,实例CPU利用率保持在60%-75%的健康区间,可用性达99.99%,未出现因容量不足导致的业务中断
  • 解决S3存储成本高企问题(月均存储费用占比25%),通过S3 Intelligent-Tiering自动将冷数据(30天未访问)迁移至Glacier Deep Archive,结合CloudFront CDN优化静态资源(图片/JS/CSS)分发,将图片平均加载时间从2.5秒降至0.8秒,同时月存储成本降低15%(约35万元)
  • 处理RDS MySQL主节点宕机事件(因可用区网络波动),优化故障转移策略:将只读从节点迁移至同region的另一可用区,设置同步超时阈值为10秒,故障转移时间从5分钟缩短至1分钟,且数据一致性达100%;后续推动RDS多可用区部署标准化,覆盖所有核心数据库实例
  • 搭建AWS云监控体系,用CloudWatch Alarms整合EC2 CPU/内存/磁盘使用率、RDS连接数/慢查询、CloudFront缓存命中率等指标,自定义Dashboard实现“全局-业务线-实例”三级可视化;报警响应时间从15分钟降至5分钟,全年处理12起潜在故障(如EC2磁盘满容、RDS连接泄漏),均未影响业务
2019.07 - 2021.07
小楷在线科技
初级云运维工程师

协助维护公司阿里云平台(cn-hangzhou region)基础设施,包括ECS、OSS、RDS的日常监控、故障排查与容量管理,支撑公司官网与小程序的业务运行

  • 排查ECS实例(ecs.t6-medium)频繁重启问题(日均2次),通过阿里云日志服务(SLS)采集系统日志与dmesg信息,定位到Linux内核(4.19版本)的OOM Killer机制误杀进程(因内核漏洞导致内存统计偏差),升级内核至5.4版本并打补丁后,3个月内无重启事件,实例稳定性提升95%
  • 优化OSS静态资源访问速度,启用跨区域复制功能将资源同步至华北2(北京)区域,结合CDN节点覆盖全国,将用户平均访问延迟从300ms降至150ms;同步设置OSS生命周期策略,将超过6个月的资源转存至归档存储,月存储成本降低10%
  • 协助搭建RDS MySQL监控体系,用CloudMonitor设置慢查询报警(执行时间>1秒)与连接数阈值(>80%最大连接数),每周生成慢查询报告并推动开发优化,累计优化5个高频慢查询(如订单列表查询),将查询时间从5秒降至1秒,数据库QPS提升25%
  • 参与官网小程序大促保障,提前1周检查ECS实例CPU使用率(峰值70%),扩容20台t6-large实例;大促期间官网访问量提升5倍,无 downtime,可用性达99.9%,支撑活动GMV突破1000万元
项目经验
2022.03 - 2023.08
星途互娱科技有限公司
运维开发负责人

混合云环境下智能运维平台重构项目

  • 项目背景:随着公司游戏业务全球化扩张,混合云(阿里云、腾讯云、AWS)资源规模突破10万+实例,原有运维平台存在跨云资源割裂、故障定位依赖人工、操作效率低等问题,导致核心游戏版本发布耗时超24小时,故障MTTR(平均修复时间)达45分钟。我的核心目标是主导重构平台,实现跨云资源统一管控与智能故障诊断,支撑业务快速迭代与稳定性保障。
  • 解决的关键难题与技术:一是跨云资源统一建模——不同云厂商API协议、资源属性差异大,数据同步延迟高;二是智能故障诊断——原有规则引擎仅覆盖30%常见故障,误报率达35%,无法识别复杂链路问题。针对前者,我设计了“抽象资源模型+云原生适配器”方案,将EC2、CVM、ECS等资源映射为统一的“计算/存储/网络”维度模型,通过自研云API网关实现协议转换(RESTful→gRPC),结合Kafka异步队列解决数据同步一致性问题;针对后者,我推动引入AIOps能力,收集metrics(Prometheus)、logs(ELK)、traces(Jaeger)多维度数据,训练“XGBoost+LSTM”混合模型,实现故障根因定位(RCA)与异常预测。
  • 核心行动与创新:牵头组建5人跨团队小组(云原生、算法、前端),历时6个月完成平台架构升级——底层采用微服务架构(Spring Cloud Alibaba),中间层封装跨云操作原子能力,上层提供“可视化管控+智能诊断”界面。创新点在于:1)轻量级机器学习推理框架集成,将模型推理延迟从1.2秒降至200ms,适配运维实时性要求;2)基于拓扑关系的故障传播链可视化,帮助运维人员快速理解故障影响范围。此外,我主导制定了《混合云运维操作规范》,将平台使用纳入团队SOP。
  • 项目成果与价值:平台上线后,跨云资源操作效率提升60%(单实例创建耗时从5分钟降至2分钟),故障MTTR缩短至8分钟,版本发布耗时压缩至12小时内。支撑了《星途纪元》全球多区域同步上线(覆盖15个国家和地区),期间未发生因运维问题导致的宕机。该平台成为公司混合云运维核心系统,节省年度运维人力成本约30%(约120万元)。我个人也因此晋升为运维开发团队负责人,负责后续平台迭代。
2020.06 - 2022.02
星途互娱科技有限公司
运维开发工程师

直播业务边缘节点自动化运维工具链研发项目

  • 项目背景:公司直播业务峰值并发超100万,边缘节点(覆盖全国31省CDN节点)从500个扩展至2000个,原有手动运维方式导致部署失败率高(75%)、故障处理滞后(30分钟内响应)。我的目标是构建边缘节点自动化运维工具链,实现“部署-监控-自愈”全流程闭环,保障直播低延迟与稳定性。
  • 解决的关键难题与技术:一是边缘节点网络不稳定,自动化部署成功率低;二是监控数据量大(单节点日均产生5GB日志),实时分析能力不足。针对前者,我基于Ansible Tower优化部署流程,开发自定义模块实现“断点续传+三次重试”机制,解决弱网环境下的包丢失问题;针对后者,采用Prometheus联邦采集边缘metrics,结合EdgeX Foundry搭建边缘数据 gateway,用Flink实现实时流处理(窗口聚合、异常检测),将数据处理延迟从10分钟降至1分钟。
  • 核心行动与创新:独立负责工具链需求调研与架构设计,梳理出“部署-配置-监控-故障处理”四大核心模块。创新点在于:1)轻量化边缘监控agent(体积<50MB),支持低资源环境运行;2)基于规则引擎+机器学习的故障自愈策略——常见故障(如进程重启、配置更新)自动处理,复杂故障触发告警并推送至移动端。此外,我编写了《边缘节点运维手册》,培训10名运维人员掌握工具使用。
  • 项目成果与价值:工具链上线后,边缘节点部署成功率提升至98%,故障处理时间缩短至5分钟内,直播卡顿率从8%降至2%。支撑了公司直播业务全年无重大故障,节省边缘运维人力成本约25%(约80万元)。该项目让我从“执行型运维”转向“方案设计型运维”,积累了边缘计算运维的核心经验,为后续混合云项目奠定了基础。
技能特长
沟通能力
执行能力
热情坦诚
文案能力
奖项荣誉
  • 信息系统运维管理工程师(中级)
  • 2022年度公司项目攻坚奖
  • 2023年度部门优秀技术员工
自我评价
  • 深耕互联网云运维,以业务连续性为核心搭高可用体系,习惯从用户端体验反推策略,提前布局容灾弹性,避免被动救火。
  • 擅长数据驱动资源优化,从利用率到成本形成闭环,锚定业务增长平衡性能投入,让云资源支撑更多核心场景。
  • 故障处理不止恢复,更沉淀根因分析与流程改进机制,推动跨团队建故障预防共识,把单点问题转组织能力迭代。
  • 跨团队用业务语言解码技术约束,让产品开发快速理解运维边界,共定支撑业务目标的方案,降沟通成本。
智能诊断
编写灵感
请选择需要查找的灵感类型
请选择灵感源泉
选择合适的内容插入后即可编辑调整
请在上方选择您需要获取的灵感类型
对话框
提示
说明