点击保存简历
模块
风格
模板
导入
  • 个人名称
  • 头像
  • 基本信息
  • 求职意向
  • 工作经历
  • 项目经验
  • 实习经验
  • 作品展示
  • 奖项荣誉
  • 校园经历
  • 教育背景
  • 兴趣爱好
  • 技能特长
  • 语言能力
  • 自我评价
  • 报考信息
  • 简历封面
  • 自荐信
陆明哲的照片
陆明哲
责任心不是口号,而是渗透在每个工作细节中的行动准则。
28岁
3年工作经验
13800138000
DB@zjengine.com
求职意向
云平台运维工程师
北京
薪资面谈
一个月内到岗
工作经历
2023.07 - 至今
小楷云链科技有限公司
云平台运维工程师

主导公有云(阿里云+腾讯云混合部署)平台稳定性运营、资源效能优化及自动化运维体系落地,对接电商、金融两条业务线的云服务需求,保障核心交易链路99.99%可用性

  • 大促期间主导核心交易链路稳定性保障:针对电商业务双11流量洪峰(预估QPS峰值12万),提前30天用阿里云ARMS、腾讯云CLB做全链路压测,发现某核心订单服务因RDS MySQL连接池参数不合理导致偶发耗尽——通过分析慢查询日志(pt-query-digest工具),调整`wait_timeout`至300秒并新增联合索引,同时用Chaos Mesh注入“数据库连接超时”故障演练,验证熔断机制有效性;大促期间该服务响应时间从200ms降至120ms,零故障支撑1.2亿订单量。
  • 资源利用率优化项目:针对闲置ECS实例(月均闲置率15%)和冗余OSS存储(冷数据占比20%),开发Python脚本结合阿里云成本管家、腾讯云费用中心做资源画像,分类标注“连续7天CPU利用率<10%”的实例,推动业务团队迁移至弹性伸缩组(AS)并绑定Spot实例;最终年度云成本下降18%,闲置资源率降至3%,释放成本约240万元。
  • 自动化资源编排体系搭建:替代手动创建云资源的低效流程,基于Terraform+Ansible构建“环境-资源”联动编排框架——用Terraform Workspaces管理开发/测试/生产环境变量,Ansible Vault加密敏感信息(如AK/SK),并将资源创建流程嵌入Jenkins Pipeline;实现EC2实例、RDS数据库、SLB负载均衡的全自动化交付,资源交付时间从4小时缩短至15分钟,人为配置错误率从8%降至0.5%。
  • 云原生迁移推动:主导 legacy 电商库存系统从虚拟机迁移至阿里云ACK容器集群——解决应用依赖特定Linux内核模块(`kernel-headers-3.10.0`)的兼容性问题,协同研发重构镜像为多阶段构建(Multi-stage Build),移除冗余依赖;迁移后部署密度提升3倍(单节点承载Pod从5个到15个),资源利用率从40%升至65%,发布频率从每周1次提升至每日3次。
2021.03 - 2023.06
小楷互联科技有限公司
高级云运维工程师

负责私有云(OpenStack)与公有云(华为云)混合云平台运维,支撑短视频业务的存储、计算及内容分发需求,保障视频上传-转码-播放全流程99.995%可用性

  • 混合云网络性能优化:针对跨云(华为云OBS存储→阿里云CDN分发)的视频转码任务延迟高问题(原500ms),用iperf3测试链路带宽,发现VPC peering路由策略冗余——调整路由表将转码流量定向至华为云高速通道,同时开启BGP Anycast优化;最终跨云API调用延迟降至150ms,单条视频转码完成时间缩短25%,支撑日均1000万条视频处理。
  • OpenStack存储稳定性修复:解决Cinder卷挂载失败问题(月均3次),分析GlusterFS后端日志发现副本同步超时——升级GlusterFS至v10.8,调整副本数从2到3并启用`gluster volume heal`自动修复,同时用Prometheus+Grafana搭建存储监控看板(采集`gluster_volume_status`等指标),设置“卷挂载失败率>0.1%”告警;后续卷挂载失败率降至0,存储可用性提升至99.995%。
  • 自动化故障诊断工具开发:针对OpenStack实例启动失败(常见原因:镜像损坏、资源配额不足),用Python+OpenStack SDK开发工具,整合ELK Stack日志收集与Ceilometer指标分析——自动提取“ImageNotFound”“QuotaExceeded”等关键字,输出故障根因报告;故障排查时间从1小时缩短至15分钟,运维效率提升70%。
  • 公有云存储成本管控:针对华为云OBS冗余数据问题(冷视频缩略图占比18%),启用OBS生命周期管理(Lifecycle Management),将30天以上数据自动归档至低频存储(Infrequent Access),并协同研发优化缩略图生成策略(从“每日全量生成”改为“用户请求时按需生成”);最终OBS存储成本下降22%,年节省约80万元。
2019.07 - 2021.02
小楷在线科技有限公司
云运维工程师

负责电商业务公有云(AWS)平台日常运维,支撑商品详情页、购物车等核心系统7x24小时运行,保障大促期间系统吞吐量满足业务增长需求

  • 大促故障应急处理:某次AWS us-east-1区域EC2实例大规模重启(因底层主机硬件故障),快速触发Auto Scaling Group自动替换实例,同时通过Route53将流量切换至us-west-2备用区域;配合研发团队切换缓存集群(从Memcached到ElastiCache),故障恢复时间控制在30分钟内,未影响用户访问,订单成功率保持在99.9%以上。
  • 监控体系从0到1搭建:基于CloudWatch+X-Ray构建核心系统监控体系——采集CPU、内存、磁盘IO及接口响应时间(如商品详情页`GET /item/{id}`)等20+指标,设置“CPU利用率>80%”触发ASG扩容、“接口延迟>500ms”触发告警;系统预警准确率提升至95%,提前发现并解决3起因数据库慢查询导致的性能瓶颈。
  • 自动化备份脚本开发:替代人工RDS备份流程,编写Shell脚本结合AWS S3做增量备份——利用`mysqldump`导出逻辑备份,上传至S3并设置“7天滚动删除”策略;备份成功率从90%升至100%,恢复时间从2小时缩短至30分钟,满足RPO<15分钟的业务要求。
  • 大促容量规划与优化:支撑618大促上线,用AWS Compute Optimizer分析历史负载,将通用型实例(t3.large)替换为计算优化型(c5.large),提升单实例QPS 40%;同时开启RDS只读副本分担读流量,大促期间系统吞吐量提升40%,商品详情页响应时间稳定在300ms以内。
项目经验
2022.03 - 2023.08
星途互动科技有限公司
运维开发工程师(高级)

社交核心系统全链路可观测性平台升级项目

  • 星途互动作为千万级日活社交平台,核心好友关系链与动态Feed流系统随用户破亿出现可观测性痛点:原有Zabbix+自研日志+第三方APM的体系割裂,故障定位耗时平均45分钟,业务与基础设施指标无法关联,严重影响用户体验与问题排查效率。我的目标是主导构建统一可观测性平台,实现故障秒级定位、业务性能精准诊断,支撑系统高可用。
  • 项目面临三大核心挑战:一是多源数据融合——旧系统日志格式混乱(文本/二进制混合)、指标维度缺失(无业务标签),无法跨层级关联;二是高基数问题——用户ID、设备ID等维度基数超10亿,传统Prometheus存储查询耗时超10秒;三是业务语义缺失——监控仅覆盖基础设施,未关联“feed流延迟→用户互动率下降”等业务影响。
  • 技术突破上,我做了三件事:1. 数据层设计“OpenTelemetry统一采集Agent”,兼容旧系统数据并标准化输出(JSON日志+按业务域分类的指标+带业务标签的链路追踪),解决了数据碎片化问题;2. 针对高基数,用ClickHouse替换Prometheus存储指标,结合Bloom Filter优化维度索引,将查询耗时降至1.5秒内;3. 搭建“业务健康度引擎”,将数据库QPS、缓存命中率等基础设施指标映射到“动态发布成功率”“好友请求延迟”等业务场景,定义综合得分(覆盖用户体验、系统稳定性、业务转化)。
  • 项目成果:故障定位时间从45分钟缩短至1分钟内,2023年Q3用户关于“动态加载慢”“好友请求失败”的投诉率下降35%;平台支持日均10万亿条日志、100亿条指标、10亿条链路数据的处理,稳定性达99.99%。我主导的“业务语义可观测性方案”申请软件著作权,输出的《社交系统可观测性最佳实践》成为公司内部运维标准,直接推动跨团队(开发、测试、产品)的可观测性协作流程落地。
2020.07 - 2021.12
星途互动科技有限公司
运维开发工程师(中级)

动态Feed流系统自动化运维平台研发项目

  • 当时负责支撑日均10亿条动态分发的Feed流系统,运维依赖人工脚本:扩容一次需2小时(手动申请资源、部署服务、配置负载均衡),故障恢复耗时30分钟(逐一排查节点、重启服务),无法应对流量暴涨(如明星八卦事件)。我的目标是研发自动化平台,实现“流量预测→自动扩容→故障自愈”的全流程闭环,提升运维效率与系统弹性。
  • 关键难点:1. 流量预测不准——Feed流流量波动大(峰值可达均值10倍),传统ARIMA模型准确率仅70%,导致扩容滞后或资源浪费;2. 自动化安全风险——批量扩容可能引发节点雪崩,缺乏有效的回滚与灰度机制;3. 跨团队协作割裂——扩容需对接开发(代码发布)、测试(灰度验证),人工协调耗时久。
  • 我的核心行动:1. 用LSTM模型结合历史流量、用户行为(发帖量、互动率)、外部事件(热搜、明星动态)训练预测模型,将流量预测准确率提升至92%;2. 设计“灰度扩容+快速回滚”机制:先扩容10%节点,监控CPU、内存、消息队列长度等指标稳定后再全量,若异常则30秒内触发回滚;3. 集成Jenkins(代码发布)、GitLab(配置管理)、Prometheus(监控),实现“预测→扩容→发布→验证”自动化,减少人工干预。
  • 项目成果:扩容时间从2小时缩短至15分钟,故障自愈率从40%提升至85%;2021年双11期间,流量暴涨8倍,平台自动完成扩容与流量调度,无用户感知。团队运维效率提升50%,该方案获公司年度技术创新奖,后续推广至公司其他核心系统(如直播、私信)。
技能特长
沟通能力
执行能力
热情坦诚
文案能力
奖项荣誉
  • 云计算运维工程师(中级)
  • 2023年度公司优秀员工
  • 2024年Q2项目攻坚奖
自我评价
  • 以业务链路为核心构建云运维体系,从用户端到基础设施全链路预判风险,而非被动救火,保障核心服务99.99%可用。
  • 擅长从资源效能、架构冗余切入降本,曾重构实例规格与调度策略,助力云成本下降20%,支撑业务高速扩张。
  • 适配互联网敏捷需求,搭建自动化故障排查与回滚流程,将关键故障MTTR压至15分钟内,匹配研发迭代节奏。
  • 习惯用业务语言翻译运维要求,比如将“数据库QPS上限”转为“大促订单提交成功率保障”,推动跨团队目标对齐。
智能诊断
编写灵感
请选择需要查找的灵感类型
请选择灵感源泉
选择合适的内容插入后即可编辑调整
请在上方选择您需要获取的灵感类型
对话框
提示
说明