点击保存简历
模块
风格
模板
导入
  • 个人名称
  • 头像
  • 基本信息
  • 求职意向
  • 工作经历
  • 项目经验
  • 实习经验
  • 作品展示
  • 奖项荣誉
  • 校园经历
  • 教育背景
  • 兴趣爱好
  • 技能特长
  • 语言能力
  • 自我评价
  • 报考信息
  • 简历封面
  • 自荐信
陆明哲的照片
陆明哲
责任心不是口号,而是渗透在每个工作细节中的行动准则。
28岁
3年工作经验
13800138000
DB@zjengine.com
求职意向
云平台运维工程师
北京
薪资面谈
一个月内到岗
工作经历
2022.06 - 2024.01
小楷科技有限公司
混合云平台负责人
  • 架构并实施了公司“全球混合云多云管理平台”,基于Cluster API和Karmada,实现了对分布在全球多个公有云区域和私有数据中心的上百个Kubernetes集群的统一部署、应用分发、策略治理与监控,管理效率提升300%。
  • 设计的“智能应用调度”策略,能根据成本(Spot实例)、网络延迟、地域合规要求,自动将工作负载调度到最优集群,年节省IT成本超20%,并保证了全球用户的访问体验。
  • 开发的“配置漂移检测与自愈”系统,定期扫描所有集群的资源配置,并与Git库中的声明式配置进行比对,发现并自动修复了数千次人工误操作导致的配置变更,确保了集群状态的最终一致性。
  • 建立的“全球网络互联与服务发现”方案,通过Service Mesh和高级网络插件,解决了跨云跨地域服务调用的延迟与稳定性问题,为全球一体化业务架构奠定了坚实基础。
2020.11 - 2022.05
小楷科技有限公司
云原生开发工程师
  • 负责公司首个“云原生技术栈”(Prometheus, Thanos, EFK, Vault)的引入与在多个集群中的部署维护,为后续的平台化建设积累了宝贵经验。
  • 使用Operators自动化管理了Redis, Kafka等有状态中间件集群,实现了其高可用部署、备份、升级的自动化,解放了运维人力。
  • 编写了大量Terraform Module和Helm Chart,实现了基础设施和应用的代码化与复用,为IaC的全面推广做出了贡献。
项目经验
2022.03 - 2023.08
星途互动科技有限公司
运维开发工程师(高级)

社交核心系统全链路可观测性平台升级项目

  • 星途互动作为千万级日活社交平台,核心好友关系链与动态Feed流系统随用户破亿出现可观测性痛点:原有Zabbix+自研日志+第三方APM的体系割裂,故障定位耗时平均45分钟,业务与基础设施指标无法关联,严重影响用户体验与问题排查效率。我的目标是主导构建统一可观测性平台,实现故障秒级定位、业务性能精准诊断,支撑系统高可用。
  • 项目面临三大核心挑战:一是多源数据融合——旧系统日志格式混乱(文本/二进制混合)、指标维度缺失(无业务标签),无法跨层级关联;二是高基数问题——用户ID、设备ID等维度基数超10亿,传统Prometheus存储查询耗时超10秒;三是业务语义缺失——监控仅覆盖基础设施,未关联“feed流延迟→用户互动率下降”等业务影响。
  • 技术突破上,我做了三件事:1. 数据层设计“OpenTelemetry统一采集Agent”,兼容旧系统数据并标准化输出(JSON日志+按业务域分类的指标+带业务标签的链路追踪),解决了数据碎片化问题;2. 针对高基数,用ClickHouse替换Prometheus存储指标,结合Bloom Filter优化维度索引,将查询耗时降至1.5秒内;3. 搭建“业务健康度引擎”,将数据库QPS、缓存命中率等基础设施指标映射到“动态发布成功率”“好友请求延迟”等业务场景,定义综合得分(覆盖用户体验、系统稳定性、业务转化)。
  • 项目成果:故障定位时间从45分钟缩短至1分钟内,2023年Q3用户关于“动态加载慢”“好友请求失败”的投诉率下降35%;平台支持日均10万亿条日志、100亿条指标、10亿条链路数据的处理,稳定性达99.99%。我主导的“业务语义可观测性方案”申请软件著作权,输出的《社交系统可观测性最佳实践》成为公司内部运维标准,直接推动跨团队(开发、测试、产品)的可观测性协作流程落地。
2020.07 - 2021.12
星途互动科技有限公司
运维开发工程师(中级)

动态Feed流系统自动化运维平台研发项目

  • 当时负责支撑日均10亿条动态分发的Feed流系统,运维依赖人工脚本:扩容一次需2小时(手动申请资源、部署服务、配置负载均衡),故障恢复耗时30分钟(逐一排查节点、重启服务),无法应对流量暴涨(如明星八卦事件)。我的目标是研发自动化平台,实现“流量预测→自动扩容→故障自愈”的全流程闭环,提升运维效率与系统弹性。
  • 关键难点:1. 流量预测不准——Feed流流量波动大(峰值可达均值10倍),传统ARIMA模型准确率仅70%,导致扩容滞后或资源浪费;2. 自动化安全风险——批量扩容可能引发节点雪崩,缺乏有效的回滚与灰度机制;3. 跨团队协作割裂——扩容需对接开发(代码发布)、测试(灰度验证),人工协调耗时久。
  • 我的核心行动:1. 用LSTM模型结合历史流量、用户行为(发帖量、互动率)、外部事件(热搜、明星动态)训练预测模型,将流量预测准确率提升至92%;2. 设计“灰度扩容+快速回滚”机制:先扩容10%节点,监控CPU、内存、消息队列长度等指标稳定后再全量,若异常则30秒内触发回滚;3. 集成Jenkins(代码发布)、GitLab(配置管理)、Prometheus(监控),实现“预测→扩容→发布→验证”自动化,减少人工干预。
  • 项目成果:扩容时间从2小时缩短至15分钟,故障自愈率从40%提升至85%;2021年双11期间,流量暴涨8倍,平台自动完成扩容与流量调度,无用户感知。团队运维效率提升50%,该方案获公司年度技术创新奖,后续推广至公司其他核心系统(如直播、私信)。
技能特长
沟通能力
执行能力
热情坦诚
文案能力
奖项荣誉
  • 阿里云ACP云计算工程师认证
  • AWS Certified SysOps Administrator - Associate
  • 2023年度公司技术攻坚奖
自我评价
  • 深耕互联网云运维6年,打通架构部署到容量管理全链路,习惯以业务峰值场景锚定平台韧性,前置规避大促级稳定性风险。
  • 故障处理坚持“根因-闭环-沉淀”,用自动化框架压MTTR至10分钟内,更推动团队建案例库降重复问题30%。
  • 对云成本敏感,能结合业务流量配弹性策略,帮前司年省18%且不影响体验。
  • 跨团队偏好“业务语言对齐”,把云价值转成产品、运营支撑点,让技术更贴业务目标。
智能诊断
编写灵感
请选择需要查找的灵感类型
请选择灵感源泉
选择合适的内容插入后即可编辑调整
请在上方选择您需要获取的灵感类型
对话框
提示
说明