点击保存简历
模块
风格
模板
导入
  • 个人名称
  • 头像
  • 基本信息
  • 求职意向
  • 工作经历
  • 项目经验
  • 实习经验
  • 作品展示
  • 奖项荣誉
  • 校园经历
  • 教育背景
  • 兴趣爱好
  • 技能特长
  • 语言能力
  • 自我评价
  • 报考信息
  • 简历封面
  • 自荐信
陆明哲的照片
28岁
3年工作经验
13800138000
DB@zjengine.com
求职意向
云平台运维工程师
北京
薪资面谈
一个月内到岗
技能特长
沟通能力
执行能力
热情坦诚
文案能力
兴趣爱好
摄影
看书
阅读
跑步
陆明哲
用系统化的思维解决问题,用温度化的方式交付成果,这是我的工作准则。
工作经历
2023.03 - 至今
小楷科技有限公司
云原生架构师
  • 主导设计并落地了公司基于Kubernetes的下一代混合云平台架构,通过Cluster API实现了对多云(AWS, Azure,私有云)集群的统一生命周期管理,使新集群交付时间从周级缩短至小时级,资源利用率提升35%,年节省基础设施成本超两千万元。
  • 设计“多租户与资源配额治理”体系,通过OpenPolicyAgent定义安全策略,通过Hierarchical Namespace Controller实现复杂的资源分层配额管理,在保证数百个业务团队隔离性的同时,实现了资源的公平共享与自动回收。
  • 攻克“万级节点集群”下的稳定性与性能瓶颈,通过优化etcd备份策略、kube-apiserver请求优先级与流量整形、以及自定义调度器扩展,将集群控制面的可用性提升至99.99%,无单点故障。
  • 建立的“云原生技术雷达与准入规范”,定义了服务网格、可观测性、GitOps等技术的选型与最佳实践,并通过开发Kyverno策略即代码,实现了对集群配置的自动化合规检查,确保了平台的整体一致性与安全性。
2021.07 - 2023.02
小楷科技有限公司
高级云原生开发工程师
  • 负责公司核心“服务网格(Istio)”的引入与落地,通过引入“渐进式流量迁移、金丝雀发布、分布式链路追踪”方案,实现了应用无感知接入,并将故障注入测试和全链路可观测性融入开发流程,使线上发布故障率下降70%。
  • 实现的“HPA与自定义指标扩缩容”策略,基于业务QPS、应用队列深度等自定义指标,实现了工作负载的精准弹性伸缩,成功应对了数次突发流量高峰,同时节省了25% 的常态资源成本。
  • 深度研发了“集群可观测性栈”(Prometheus + Thanos + Loki + Grafana),实现了指标、日志、链路的统一采集、存储与告警,将故障平均发现时间(MTTD)缩短至2分钟以内。
项目经验
2022.03 - 2023.08
星途互动科技有限公司
运维开发工程师(高级)

社交核心系统全链路可观测性平台升级项目

  • 星途互动作为千万级日活社交平台,核心好友关系链与动态Feed流系统随用户破亿出现可观测性痛点:原有Zabbix+自研日志+第三方APM的体系割裂,故障定位耗时平均45分钟,业务与基础设施指标无法关联,严重影响用户体验与问题排查效率。我的目标是主导构建统一可观测性平台,实现故障秒级定位、业务性能精准诊断,支撑系统高可用。
  • 项目面临三大核心挑战:一是多源数据融合——旧系统日志格式混乱(文本/二进制混合)、指标维度缺失(无业务标签),无法跨层级关联;二是高基数问题——用户ID、设备ID等维度基数超10亿,传统Prometheus存储查询耗时超10秒;三是业务语义缺失——监控仅覆盖基础设施,未关联“feed流延迟→用户互动率下降”等业务影响。
  • 技术突破上,我做了三件事:1. 数据层设计“OpenTelemetry统一采集Agent”,兼容旧系统数据并标准化输出(JSON日志+按业务域分类的指标+带业务标签的链路追踪),解决了数据碎片化问题;2. 针对高基数,用ClickHouse替换Prometheus存储指标,结合Bloom Filter优化维度索引,将查询耗时降至1.5秒内;3. 搭建“业务健康度引擎”,将数据库QPS、缓存命中率等基础设施指标映射到“动态发布成功率”“好友请求延迟”等业务场景,定义综合得分(覆盖用户体验、系统稳定性、业务转化)。
  • 项目成果:故障定位时间从45分钟缩短至1分钟内,2023年Q3用户关于“动态加载慢”“好友请求失败”的投诉率下降35%;平台支持日均10万亿条日志、100亿条指标、10亿条链路数据的处理,稳定性达99.99%。我主导的“业务语义可观测性方案”申请软件著作权,输出的《社交系统可观测性最佳实践》成为公司内部运维标准,直接推动跨团队(开发、测试、产品)的可观测性协作流程落地。
2020.07 - 2021.12
星途互动科技有限公司
运维开发工程师(中级)

动态Feed流系统自动化运维平台研发项目

  • 当时负责支撑日均10亿条动态分发的Feed流系统,运维依赖人工脚本:扩容一次需2小时(手动申请资源、部署服务、配置负载均衡),故障恢复耗时30分钟(逐一排查节点、重启服务),无法应对流量暴涨(如明星八卦事件)。我的目标是研发自动化平台,实现“流量预测→自动扩容→故障自愈”的全流程闭环,提升运维效率与系统弹性。
  • 关键难点:1. 流量预测不准——Feed流流量波动大(峰值可达均值10倍),传统ARIMA模型准确率仅70%,导致扩容滞后或资源浪费;2. 自动化安全风险——批量扩容可能引发节点雪崩,缺乏有效的回滚与灰度机制;3. 跨团队协作割裂——扩容需对接开发(代码发布)、测试(灰度验证),人工协调耗时久。
  • 我的核心行动:1. 用LSTM模型结合历史流量、用户行为(发帖量、互动率)、外部事件(热搜、明星动态)训练预测模型,将流量预测准确率提升至92%;2. 设计“灰度扩容+快速回滚”机制:先扩容10%节点,监控CPU、内存、消息队列长度等指标稳定后再全量,若异常则30秒内触发回滚;3. 集成Jenkins(代码发布)、GitLab(配置管理)、Prometheus(监控),实现“预测→扩容→发布→验证”自动化,减少人工干预。
  • 项目成果:扩容时间从2小时缩短至15分钟,故障自愈率从40%提升至85%;2021年双11期间,流量暴涨8倍,平台自动完成扩容与流量调度,无用户感知。团队运维效率提升50%,该方案获公司年度技术创新奖,后续推广至公司其他核心系统(如直播、私信)。
教育背景
2013.09 - 2016.06
XX市第一中学
理科重点班
通过系统化的数理课程训练(物理/数学竞赛班),培养了严密的逻辑思维能力和复杂问题拆解方法论;担任校科技社副社长期间,主导“简易机器人编程”项目,锻炼了技术方案落地的执行力,获省级创新大赛三等奖。
2016.09 - 2020.06
XX理工大学
计算机科学与技术(本科)
主修数据结构、算法设计等核心课程(GPA 3.7/4.0),构建系统性技术知识框架;通过校企合作项目“智慧校园小程序开发”(担任后端组长),将理论转化为高并发场景下的解决方案,服务3所高校超2万用户。获校级“技术创新标兵”(Top 5%)。
奖项荣誉
  • 信息系统运行维护员(高级)职业技能等级证书
  • 阿里云ACP云计算工程师认证
  • 2022年度公司项目攻坚奖
自我评价
  • 深耕互联网云运维,以业务连续性为核心搭高可用体系,习惯从用户端体验反推策略,提前布局容灾弹性,避免被动救火。
  • 擅长数据驱动资源优化,从利用率到成本形成闭环,锚定业务增长平衡性能投入,让云资源支撑更多核心场景。
  • 故障处理不止恢复,更沉淀根因分析与流程改进机制,推动跨团队建故障预防共识,把单点问题转组织能力迭代。
  • 跨团队用业务语言解码技术约束,让产品开发快速理解运维边界,共定支撑业务目标的方案,降沟通成本。
智能诊断
编写灵感
请选择需要查找的灵感类型
请选择灵感源泉
选择合适的内容插入后即可编辑调整
请在上方选择您需要获取的灵感类型
对话框
提示
说明