点击保存简历
模块
风格
模板
导入
  • 个人名称
  • 头像
  • 基本信息
  • 求职意向
  • 工作经历
  • 项目经验
  • 实习经验
  • 作品展示
  • 奖项荣誉
  • 校园经历
  • 教育背景
  • 兴趣爱好
  • 技能特长
  • 语言能力
  • 自我评价
  • 报考信息
  • 简历封面
  • 自荐信
陆明哲的照片
陆明哲
用系统化的思维解决问题,用温度化的方式交付成果,这是我的工作准则。
28岁
3年工作经验
13800138000
DB@zjengine.com
求职意向
实时计算开发工程师
杭州
薪资面谈
一个月内到岗
工作经历
2022.05 - 2023.12
小楷云计算有限公司
实时数仓技术专家
  • 主导研发了公司基于Apache Hudi和Flink流批一体数据湖仓技术方案,实现了对Kafka实时数据的“秒级入湖”与“增量查询”。该方案成功将传统Lambda架构升级为Kappa架构,简化了技术栈,并保证了实时与离线数据在一份存储中的一致性。
  • 独立设计的“多流实时关联”优化策略,通过自定义Flink Operator和利用“流式维表”(如Redis),解决了高吞吐主流量与低吞吐维度流关联时的性能瓶颈,将关联成功率提升至99.9%,保障了实时数据模型的准确性。
  • 推动该方案成功产品化,作为PaaS服务对外输出,吸引了数十家大型企业客户,年创造营收超三百万元,并成为公司对标Snowflake、Databricks的核心竞争力之一。
  • 实现实时物化视图功能,能够自动将高频查询预计算成中间结果,使得超大规模数据的即席查询响应时间从分钟级降至亚秒级,赋能了交互式实时分析场景。
2020.10 - 2022.0
小楷云计算有限公司
大数据开发工程师
  • 架构并实现​​实时数仓​​建设,统一流量、交易、用户行为等核心业务数据的实时模型,为实时大屏、BI报表和特征工程提供毫秒级数据支撑,替代原T+1模式,决策效率提升​​70%​​。
  • 设计并开发​​实时推荐特征工程​​ pipeline,处理机房QPS超​​50万​​,将用户行为数据转化为特征送入推荐模型的延迟控制在​​100ms​​内,助推业务点击率提升​​3%​​。
  • 攻克大促期间数据倾斜难题,通过自定义分区器与​​LocalKeyBy​​预聚合方案,将热点订单数据处理能力提升​​5倍​​,保障大促平稳运行。
  • 推动流批一体技术落地,部分场景使用​​Apache Iceberg​​作为流批统一存储,减少重复计算,资源成本降低​​30%​​。
2019.07 - 2020.10
小楷云计算有限公司
实时数据服务负责人
  • 负责公司​​实时风控系统​​核心模块开发,基于Flink实现滑动窗口聚合与规则引擎,实时识别欺诈交易,每分钟处理​​10万+​​事件,召回率​​90%​​,误判率低于​​0.1%​​。
  • 维护和优化实时数据抽取(CDC)链路,使用​​Debezium​​同步MySQL binlog至Kafka,保证端到端​​Exactly-Once​​语义,数据零丢失。
  • 构建实时作业监控告警体系,基于​​Prometheus​​和​​Grafana​​监控作业反压、延迟、吞吐量,告警准确率​​99%​​,实现问题分钟级发现与定位。
  • 参与搭建公司首个​​Flink on K8s​​集群,实现资源弹性调度,资源利用率提升​​25%​​。
项目经验
2022.03 - 2023.08
星途互动科技有限公司
大数据开发负责人

用户行为实时分析平台与个性化推荐引擎升级项目

  • 星途互动作为聚焦Z世代的内容社交平台,MAU突破5000万时遇到增长瓶颈——现有实时数仓因数据倾斜、Checkpoint不稳定导致特征延迟超5秒,推荐模型AUC仅0.72,无法支撑“千人千面”的个性化体验需求。我作为大数据开发负责人,主导全链路实时数据处理与推荐特征优化项目,目标是将实时数仓端到端延迟压至1秒内,推动推荐模型准确性提升。
  • 项目面临两大核心挑战:一是用户行为事件流因头部用户占比20%却产生80%事件导致KeyedStream状态爆炸,Flink作业Checkpoint失败率达15%;二是实时特征依赖离线ETL同步,滞后30分钟,无法捕捉用户即时兴趣变化。针对数据倾斜,我通过Flink动态分区策略,基于用户活跃度实时调整Key分组权重,将大Key拆分为多个子Key并行处理;针对特征滞后,设计“流批一体实时特征工厂”,用Flink SQL结合Redis Stream实现特征秒级更新,同时通过窗口一致性校验保证数据准确性。
  • 我主导重构了实时数仓分层架构,将原有单一ODS-DWD-DWS调整为“原始层-缓冲层-聚合层-特征层”:缓冲层引入Kafka分层Topic机制,隔离高并发写入与低延迟处理;特征层创新设计“基于事件时间的滑动窗口兴趣衰减向量”,融合用户最近10分钟的行为序列(点击、点赞、评论),赋予近期行为更高权重,更精准反映用户即时偏好。同时推动跨团队对齐特征规范,确保实时特征与算法模型的无缝对接。
  • 项目上线后,实时数仓端到端延迟从5.2秒降至0.8秒,推荐模型AUC提升至0.84,平台CTR较之前增长11.3%,日均支撑35亿条用户行为数据的实时处理。我主导的动态分区策略与特征工厂方案被纳入公司大数据开发规范,成为后续实时数仓项目的标准架构,我个人也因此晋升为大数据架构师。
2020.10 - 2022.02
星途互动科技有限公司
高级大数据开发工程师

企业级大数据平台数据资产化管理与成本管控项目

  • 随着平台数据量年增长80%,大数据平台存储成本占比达研发预算的30%,且存在大量重复日志、无效用户行为数据,数据查找耗时平均1小时以上,业务团队常因“找不到数据”“数据不准”延误项目。我作为高级大数据开发工程师,主导数据资产化管理与成本管控项目,目标是建立全链路数据资产目录,将存储成本降低30%,提升数据复用率。
  • 项目核心痛点在于:一是缺乏统一元数据管理,数据来源分散在业务库、日志采集、第三方接口,无法快速定位可用数据;二是冷热数据未分层,所有数据均存放在SSD上,成本高且利用率低。我采用Apache Atlas搭建元数据管理系统,通过自定义采集器同步Flink、Hive、ClickHouse的元数据,给每条数据打“业务域”“数据类型”“更新频率”“热度”四大标签;同时设计“动态存储策略引擎”,基于标签自动将数据迁移至对应存储介质——热数据(日查询≥10次)存SSD保留7天,温数据(周查询≥1次)存HDFS保留30天,冷数据(月查询≤1次)存OSS长期归档。
  • 我主导制定了《星途数据资产分类标准》,将数据分为用户行为、内容元数据、业务流程三大类,每类定义统一命名规范与字段标准;创新实现“数据热度实时监控”,通过Flink实时统计数据的查询次数与访问时长,每10分钟更新一次热度标签,触发存储迁移。同时推动建立“数据Owner”制度,明确各部门数据维护责任,从源头减少无效数据产生。
  • 项目完成后,平台存储成本较之前降低38%,数据查找时间缩短至8分钟内,数据复用率从22%提升至65%。元数据管理系统覆盖了95%以上的业务数据,彻底解决了“找数据难”的问题。该项目的成本管控方案被集团其他3条业务线复用,我个人也因此积累了从技术执行到数据治理的全流程经验。
技能特长
沟通能力
执行能力
热情坦诚
文案能力
奖项荣誉
  • 大数据工程技术人员(中级)
  • 2023年度公司项目攻坚奖
  • 2024年互联网行业实时计算优秀案例奖
自我评价
  • 深耕互联网实时计算赛道,擅长将业务需求转化为低延迟、高并发的实时数据处理链路,聚焦架构设计及性能优化。
  • 对Flink等引擎底层机制有深度理解,习惯从状态管理、故障恢复维度系统性解决稳定性与延迟痛点。
  • 以业务价值为核心,主动联动产品拆解实时指标需求,推动计算结果直接支撑推荐、风控等关键场景决策。
  • 技术敏感度强,持续跟踪新框架并快速验证适配性,始终保持对实时计算前沿方向的敏锐洞察。
智能诊断
编写灵感
请选择需要查找的灵感类型
请选择灵感源泉
选择合适的内容插入后即可编辑调整
请在上方选择您需要获取的灵感类型
对话框
提示
说明