当前模板已根据「数据仓库开发工程师」岗位深度优化
选择其他岗位
开始编辑模板后,您可以进一步自定义包括:工作履历、工作内容、信息模块、颜色配置等
内置经深度优化的履历,将为你撰写个人简历带来更多灵感。
陆明哲
责任心不是口号,而是渗透在每个工作细节中的行动准则。
28岁
3年工作经验
13800138000
DB@zjengine.com
陆明哲的照片
求职意向
数据仓库开发工程师
宁波
薪资面谈
一周内到岗
工作经历
2022.07 - 2024.08
小楷同城生活服务有限公司
资深数据仓库开发工程师

负责同城生活服务平台全链路数据资产建设,覆盖用户行为、交易履约、商户运营三大核心域的数据整合与标准化,主导数据仓库分层架构优化及元数据管理体系落地,支撑营销、运营、风控等业务线的精准决策需求

  • 主导用户行为数据域重构项目,基于Kimball维度建模理论整合App埋点、小程序日志、第三方支付回调等多源数据,用Spark SQL完成日均15TB数据清洗关联,通过设计UUID+设备指纹联合标识体系解决跨端用户ID映射不一致问题,将用户行为数据可用率从78%提升至95%,支撑营销活动ROI分析效率提升40%
  • 核心参与数据仓库元数据管理平台搭建,选用Apache Atlas作为元数据采集引擎,结合自研标签体系实现表级、字段级元数据自动化同步与血缘追踪,解决原元数据分散在ETL脚本中查找困难的问题,元数据查询耗时从平均30分钟缩短至5分钟内,业务线数据需求响应速度提升50%
  • 重点优化交易履约数据仓库分层逻辑,将原有ODS-DWD-DWS三层扩展为含ADS的四层体系,引入Hudi增量更新替代传统T+1全量同步,把订单履约数据产出时效从次日8点提前至当日12点,满足风控团队实时交易风险预警需求,风险识别准确率提升25%
  • 负责商户运营数据集市开发,基于维度建模设计商户生命周期、经营能力、用户评价三大主题模型,用ClickHouse存储聚合指标,支持运营团队快速查询“近30天活跃商户指标变化”“高客单价商户用户画像分布”等问题,日均查询次数从120次提升至800次,运营决策精准度提升30%
2020.06 - 2022.06
小楷生活科技数据有限公司
数据仓库开发工程师

负责生活服务类平台交易与商户数据的数据仓库建设,聚焦多源数据整合、标准化及基础主题模型开发,支撑运营与产品团队日常分析需求,同时参与数据质量体系初步搭建

  • 主导交易数据域整合项目,处理美团、饿了么第三方订单(用Sqoop增量同步)及自有平台订单,通过设计统一订单维度表(含订单ID、用户ID等核心维度)解决多源结构不一致问题,日均处理8TB订单数据,数据一致性从85%提升至98%
  • 核心参与商户数据主题模型开发,基于星型模型设计商户基础信息、经营指标、用户评价三大主题,用Hive SQL计算月均订单量、好评率等指标并存储至HBase,解决原商户数据分散在Excel的问题,运营团队获取数据时间从1天缩短至10分钟内
  • 负责数据质量体系初步搭建,设计订单金额非空、用户ID格式正确等校验规则,用DataWorks数据质量模块实现自动化校验,每天拦截1.2万条异常数据,数据质量问题投诉率从每周5次降至每周1次以内
  • 支撑营销活动数据分析,开发“活动参与用户画像”“转化漏斗”等指标并用Tableau可视化,帮助营销团队优化策略,某次满减活动转化率提升18%、参与用户数增长25%
2018.03 - 2020.05
小楷网络科技有限公司
初级数据仓库开发工程师

协助数据仓库基础建设,负责数据抽取、清洗及简单主题模型开发,参与数据文档编写维护,保障数据仓库稳定运行

  • 协助完成ODS层基础数据抽取,用Sqoop从MySQL同步用户、商户、商品数据,日均同步1TB,通过编写Shell脚本实现任务定时执行与错误告警,任务成功率从90%提升至99%
  • 负责简单数据清洗,用Hive ROW_NUMBER()函数去重用户表重复数据、通过均值填充补全缺失数据,清洗后数据可用率达95%以上,支撑后续DWD层开发
  • 开发用户行为简单主题模型,用Hive SQL计算日活用户数、用户停留时长等指标并存储至MySQL,帮助产品团队了解用户基础行为特征
  • 参与数据文档编写维护,整理《ODS层数据字典》《简单指标计算逻辑》等文档,覆盖100+张表和50+个指标,新员工熟悉数据仓库时间缩短30%
项目经验
2022.03 - 2023.08
星途互动科技有限公司
大数据开发负责人

社交产品实时用户行为数仓构建及推荐特征优化项目

  • 项目背景:公司核心社交APP用户增长陷入停滞,推荐系统因依赖离线特征导致实时性不足,CTR较行业均值低18%,DAU连续3个月未突破800万。核心目标是通过构建实时用户行为数仓,支撑推荐系统毫秒级特征计算,提升流量转化效率。我的职责是主导全链路技术方案设计,协调算法、产品、前端团队对齐特征口径与迭代节奏。
  • 解决的关键难题:1)多源数据(APP、小程序、H5)的schema频繁变更(月均12次),传统离线数仓无法适配实时场景;2)实时特征计算需兼顾低延迟(<100ms)与状态一致性,Flink任务偶发checkpoint失败导致数据延迟;3)业务线特征重复开发,计算资源利用率仅35%。技术上采用Flink CDC同步MySQL用户属性,结合Schema Registry实现schema动态映射,解决多源数据一致性问题;通过RocksDB状态后端+增量checkpoint优化,将任务失败率从8%降至1%以下。
  • 核心行动与创新:牵头设计实时数仓四层模型(ODS原始行为层->DWD事件关联层->DWS用户行为宽表层->ADS推荐特征层),其中DWD层通过Flink SQL实现“用户点击-评论-转发”全链路事件关联;针对推荐系统需求,开发“好友互动热度标签”“近期兴趣衰减特征”等23个实时特征,接入公司特征平台实现秒级更新;引入Redis Cluster做特征缓存,将高频特征访问延迟从500ms压降至70ms以内。此外,设计“业务变更-特征同步”的自动化流程,减少人工干预80%。
  • 项目成果:实时数仓延迟稳定在80ms内,推荐系统CTR提升22%至行业均值以上,DAU增长15%至920万;特征复用率从35%提升至72%,每月节省30%离线计算资源(约120台EMR节点);项目支撑“兴趣feed流”核心功能上线,成为Q3公司DAU增长的主要驱动。个人主导的技术方案被纳入公司大数据实时开发规范,带教3名初级工程师掌握实时数仓设计与特征开发能力。
2021.06 - 2022.02
星途互动科技有限公司
大数据开发工程师

用户行为数据湖成本治理与价值激活项目

  • 项目背景:公司用户行为数据湖(HDFS+Iceberg)存储规模达120PB,年存储成本超800万,且因元数据混乱、数据冗余,业务部门取数耗时平均2小时,35%数据半年内未被访问。核心目标是降低存储成本30%,提升查询性能50%,激活沉睡数据价值。我的职责是主导数据湖重构与治理,梳理数据资产并优化存储查询效率。
  • 解决的关键难题:1)元数据缺失导致重复数据达40%(如同一用户行为日志被多任务写入不同目录);2)查询未利用Iceberg分区与索引能力,常扫描全表数据;3)缺乏生命周期策略,冷数据未及时归档。技术上采用Apache Atlas搭建元数据平台,追踪数据lineage识别冗余;优化Iceberg表分区为“日期+用户地域”(原始层)与“行为类型+时间窗口”(聚合层),提升查询剪枝效率;引入数据血缘工具自动标记沉睡数据。
  • 核心行动与创新:完成全量数据盘点,清理42PB重复数据;重构“原始层-清洗层-聚合层-归档层”四层模型,原始数据迁移至OSS冷存储,聚合数据同步至ClickHouse做OLAP查询;制定生命周期策略:原始数据保留3年、清洗数据保留2年、归档数据每月迁移至冷存储并删除冗余副本。此外,为“用户日活”“行为转化率”等高频查询创建物化视图,预计算指标减少实时计算量。
  • 项目成果:存储成本降低35%至每年520万,查询性能提升60%,业务取数时间缩短至15分钟内;激活12个沉睡数据集,支撑运营部“老用户召回活动”转化率提升18%、产品部“用户画像优化”项目落地;个人主导的数据治理流程推广至全公司,成为后续数据湖建设标准规范,本人获公司“年度数据价值贡献奖”。
自我评价
  • 深耕互联网数仓领域,擅长将业务场景抽象为高可用架构,始终以“数据支撑业务决策”为设计核心,拒绝技术冗余。
  • 具备全链路问题排查思维,用“日志-元数据-业务逻辑”三角法定位瓶颈,推动过关键链路性能提升。
  • 作为技术与业务的翻译官,能将业务需求转化为可量化指标体系,减少跨团队沟通成本。
  • 对数据质量有极致敏感,建立分层校验机制保障一致性,主动跟进云原生技术优化存储效率。
兴趣爱好
摄影
看书
阅读
跑步
试一下,换个颜色
选择配色
使用此模板创建简历
  • 支持电脑端、微信小程序编辑简历
  • 支持一键更换模板,自由调整字距行距
  • 支持微信分享简历给好友查看
  • 支持简历封面、自荐信、自定义简历模块
  • 支持导出为PDF、图片、在线打印、云端保存
该简历模板已内置
  • 个人名称
  • 头像
  • 基本信息
  • 求职意向
  • 工作经历
  • 项目经验
  • 实习经验
  • 作品展示
  • 奖项荣誉
  • 校园经历
  • 教育背景
  • 兴趣爱好
  • 技能特长
  • 语言能力
  • 自我评价
  • 报考信息
  • 简历封面
  • 自荐信
对话框
提示
说明