点击保存简历
模块
风格
模板
导入
  • 个人名称
  • 头像
  • 基本信息
  • 求职意向
  • 工作经历
  • 项目经验
  • 实习经验
  • 作品展示
  • 奖项荣誉
  • 校园经历
  • 教育背景
  • 兴趣爱好
  • 技能特长
  • 语言能力
  • 自我评价
  • 报考信息
  • 简历封面
  • 自荐信
陆明哲的照片
陆明哲
在平凡的岗位上创造不平凡的价值,这是我的职业信仰。
28岁
3年工作经验
13800138000
DB@zjengine.com
求职意向
云平台运维工程师
北京
薪资面谈
随时到岗
工作经历
2023.03 - 至今
小楷科技有限公司
云原生架构师
  • 主导设计并落地了公司基于Kubernetes的下一代混合云平台架构,通过Cluster API实现了对多云(AWS, Azure,私有云)集群的统一生命周期管理,使新集群交付时间从周级缩短至小时级,资源利用率提升35%,年节省基础设施成本超两千万元。
  • 设计“多租户与资源配额治理”体系,通过OpenPolicyAgent定义安全策略,通过Hierarchical Namespace Controller实现复杂的资源分层配额管理,在保证数百个业务团队隔离性的同时,实现了资源的公平共享与自动回收。
  • 攻克“万级节点集群”下的稳定性与性能瓶颈,通过优化etcd备份策略、kube-apiserver请求优先级与流量整形、以及自定义调度器扩展,将集群控制面的可用性提升至99.99%,无单点故障。
  • 建立的“云原生技术雷达与准入规范”,定义了服务网格、可观测性、GitOps等技术的选型与最佳实践,并通过开发Kyverno策略即代码,实现了对集群配置的自动化合规检查,确保了平台的整体一致性与安全性。
2021.07 - 2023.02
小楷科技有限公司
高级云原生开发工程师
  • 负责公司核心“服务网格(Istio)”的引入与落地,通过引入“渐进式流量迁移、金丝雀发布、分布式链路追踪”方案,实现了应用无感知接入,并将故障注入测试和全链路可观测性融入开发流程,使线上发布故障率下降70%。
  • 实现的“HPA与自定义指标扩缩容”策略,基于业务QPS、应用队列深度等自定义指标,实现了工作负载的精准弹性伸缩,成功应对了数次突发流量高峰,同时节省了25% 的常态资源成本。
  • 深度研发了“集群可观测性栈”(Prometheus + Thanos + Loki + Grafana),实现了指标、日志、链路的统一采集、存储与告警,将故障平均发现时间(MTTD)缩短至2分钟以内。
项目经验
2022.05 - 2023.10
星途互娱
运维开发负责人

文娱业务低延迟高可用运维平台研发及规模化落地

  • 项目背景:公司文娱业务(直播、长视频、会员系统)用户量年增长40%,现有运维体系存在工具碎片化(分散的监控、配置、自动化工具)、故障排查耗时(平均45分钟/次)、资源成本超支(年度服务器成本占比营收18%)等痛点。核心目标是构建统一运维平台,实现“高可用保障、低延迟监控、自动化运维”,支撑业务快速迭代。我作为运维开发负责人,主导平台整体设计、跨团队需求对齐及落地推进。
  • 关键难题与技术方案:a) 多环境配置一致性难——传统手动配置易出错;b) 直播流低延迟监控缺失——传统Prometheus 60秒采集间隔无法满足端到端≤500ms延迟的实时追踪;c) 故障自愈覆盖不足——高频问题(如Pod重启、数据库连接池耗尽)仍需人工干预。针对性方案:采用Terraform+Ansible组合实现配置代码化;自研直播流延迟Exporter,整合CDN日志、应用埋点及网络探针数据,将采集间隔缩短至10秒;基于Python开发20+高频故障自愈剧本,联动告警系统自动修复。
  • 核心行动与创新:牵头组织研发、产品、运营3轮痛点调研,输出《运维痛点清单》及需求文档;设计“配置管理-监控告警-自动化运维-成本分析”微服务架构(Spring Cloud);带领5人团队完成Exporter开发、Terraform模板编写及自愈剧本调试;推动预发环境1个月灰度验证,再逐步推广至生产核心业务。
  • 项目成果与价值:平台上线6个月覆盖80%核心业务,故障排查时间降至8分钟内,自动化率从35%提升至75%;年度服务器成本降低22%(约节省1200万元),支撑“暑期直播季”零重大故障,用户观看延迟降低15%。我个人主导的平台架构获公司“年度技术创新奖”,成为新业务运维标准底座。
2020.08 - 2022.03
星途互娱
运维开发核心成员

短视频核心服务容器化迁移与弹性伸缩体系搭建

  • 项目背景:公司短视频业务爆发(月活从1亿增至3亿),传统虚拟机部署存在资源利用率低(30%)、扩容慢(15分钟/次)、交付周期长(每周2个服务)等问题。核心目标是将feed流、视频上传等核心服务迁移至Kubernetes,构建弹性伸缩体系。我作为运维开发核心成员,负责容器化适配、弹性策略设计及迁移落地。
  • 关键难题与技术方案:a) 老服务(Spring Boot 1.x)依赖本地文件系统及固定IP,迁移后服务发现失败、日志丢失;b) 流量波动大(热点事件QPS暴涨5倍),传统CPU指标HPA无法满足快速扩容;c) 迁移需保障业务连续性。解决方案:用Helm打包服务,定制化NFS解决文件依赖,通过Istio实现服务发现;构建多维度弹性指标(QPS+延迟+错误率+CPU),自定义HPA策略将扩容阈值从“CPU≥70%”调整为“QPS≥1万且延迟≥2秒”;制定“灰度迁移+回滚预案”,开发迁移状态监控面板。
  • 核心行动与创新:对12个核心服务做容器化评估,输出《迁移可行性报告》及“先易后难”路线图;开发自动化工具将虚拟机配置转为K8s YAML,减少人工错误;压测验证伸缩效果,调整指标权重;推动研发优化代码(增加缓存、减少DB连接)提升容器性能。
  • 项目成果与价值:3个月完成12个服务迁移,资源利用率从30%升至65%,扩容时间降至2分钟内;支撑峰值QPS从5万提至20万,无扩容故障;运维人力成本降低40%(原3人部署现1人自动化完成)。该弹性体系成为公司K8s集群标准配置,后续新服务默认采用。
奖项荣誉
  • 信息系统运行维护员(高级)职业技能等级证书
  • 阿里云ACP云计算工程师认证
  • 2022年度公司项目攻坚奖
技能特长
沟通能力
执行能力
热情坦诚
文案能力
自我评价
  • 深耕互联网云运维,以业务连续性为核心搭高可用体系,习惯从用户端体验反推策略,提前布局容灾弹性,避免被动救火。
  • 擅长数据驱动资源优化,从利用率到成本形成闭环,锚定业务增长平衡性能投入,让云资源支撑更多核心场景。
  • 故障处理不止恢复,更沉淀根因分析与流程改进机制,推动跨团队建故障预防共识,把单点问题转组织能力迭代。
  • 跨团队用业务语言解码技术约束,让产品开发快速理解运维边界,共定支撑业务目标的方案,降沟通成本。
智能诊断
编写灵感
请选择需要查找的灵感类型
请选择灵感源泉
选择合适的内容插入后即可编辑调整
请在上方选择您需要获取的灵感类型
对话框
提示
说明