点击保存简历
模块
风格
模板
导入
  • 个人名称
  • 头像
  • 基本信息
  • 求职意向
  • 工作经历
  • 项目经验
  • 实习经验
  • 作品展示
  • 奖项荣誉
  • 校园经历
  • 教育背景
  • 兴趣爱好
  • 技能特长
  • 语言能力
  • 自我评价
  • 报考信息
  • 简历封面
  • 自荐信
陆明哲的照片
陆明哲
昨天的经验是今天的基石,而今天的突破将成为明天的标准。
28岁
3年工作经验
13800138000
DB@zjengine.com
求职意向
数据治理工程师
东莞
薪资面谈
到岗时间另议
工作经历
2023.07 - 2025.06
小楷电商科技
高级数据治理工程师

负责电商平台全链路数据资产(商品、订单、用户、营销域)的全生命周期治理,涵盖元数据智能管理、数据质量闭环管控、主数据标准化及跨域数据一致性保障,支撑业务决策分析、数据产品落地及大促场景的数据可靠性。

  • 主导设计基于Apache Atlas 2.2的元数据管理平台2.0迭代,针对前期元数据分散(覆盖20+业务系统如商品中心、订单履约、营销活动)、血缘关系断层问题,调研业务线元数据需求并输出《电商元数据标准手册》,通过Atlas Schema Registry实现元数据自动采集(日均增量10万+条),结合Groovy自定义规则引擎校验元数据完整性(比如字段描述必填、表标签规范),最终元数据覆盖率从65%提升至92%,血缘关系可视化率100%,帮助数据分析师定位数据源效率提升40%,支撑了用户增长团队的归因分析场景落地。
  • 核心参与电商双11/618大促数据质量保障项目,解决往届大促期间订单金额异常、支付时间倒序等问题,建立“事前规则预审(联合业务方审核数据规则合理性)+事中实时监控(用阿里云DataWorks数据质量模块配置150+条规则,对接Flink实时数据流处理每秒10万+条数据)+事后复盘闭环(输出异常数据根因报告并推动系统改造)”的质量体系,大促期间拦截异常数据3.2万条,数据错误率从0.15%降至0.02%,保障了满减活动、秒杀场景的用户触达与交易准确性。
  • 牵头商品主数据标准化项目,针对商品分类(运营系统“服饰鞋包”vs数据仓库“服装配饰”)、属性字段(库存单位SKU编码规则不一致)跨部门混乱问题,采用DAMA-DMBOK主数据管理方法论,联合商品中心、运营部、数据部制定《商品主数据统一规范》(含8位品类码+4位属性码编码规则、12个核心字段的填写标准),开发基于Kafka Connect的主数据同步工具实现源系统到各业务系统的实时同步(延迟≤1分钟),商品数据不一致率从18%降至3%,直接提升用户推荐算法的CTR(点击率)8%与转化率5%。
  • 推动数据治理流程自动化,解决人工运维成本高的痛点:用Python开发元数据变更通知机器人(对接企业微信API),当表结构、字段含义变更时自动触发通知给相关业务方与分析师,减少80%的人工告知工作量;同时用Terraform实现DataWorks数据质量规则的IaC(基础设施即代码),规则部署时间从2小时缩短至15分钟,团队运维效率提升75%。
2021.03 - 2023.06
小楷零售科技
数据治理工程师

负责零售业务(线下门店、线上商城、供应链)数据资产的治理与管控,聚焦元数据标准化、数据质量提升及跨部门数据协同,支撑业务报表准确性、用户画像构建及供应链优化场景。

  • 主导零售数据仓库元数据标准化项目,梳理POS系统、会员系统、供应链系统等10+数据源的元数据,输出《零售元数据命名与分类规范》(比如维度表以“dim_”前缀、事实表以“fact_”前缀命名),通过Apache Atlas实现元数据自动采集与关联,元数据查找时间从平均15分钟缩短至3分钟,帮助数据工程师减少30%的跨系统沟通成本。
  • 优化会员数据质量监控体系,针对会员手机号格式错误、积分余额负数、注册时间晚于首次消费时间等高频问题,引入Scikit-learn训练异常检测模型(基于历史问题数据标注的特征工程),结合DataWorks实时监控规则,会员数据错误率从0.2%降至0.05%,支撑了精准营销活动的用户触达(转化率提升5%),并通过钉钉机器人自动推送异常数据给运营人员,修复时效从24小时缩短至4小时。
  • 推动跨部门数据协同机制建立,解决市场部与销售部“新用户”口径不一致问题(市场部定义为首次注册,销售部定义为首次下单),采用数据治理术语表工具(Collibra)制定统一数据口径文档,并开发口径查询平台(基于Vue.js+Spring Boot),让业务方自主查询数据定义,跨部门沟通时间减少40%,业务报表的一致性提升至95%。
  • 负责数据治理培训体系建设,针对业务人员数据意识薄弱问题,开发《零售数据基础与治理实践》课程(覆盖元数据、数据质量、数据安全等6个模块),累计培训运营、市场、供应链人员120人次,业务人员主动提交数据质量问题数量从每月5条提升至15条,形成“业务参与、数据赋能”的治理文化。
2019.07 - 2021.02
小楷电商运营
数据专员(数据治理方向)

协助数据团队开展基础数据治理工作,包括元数据梳理、数据质量检查及业务部门数据需求对接,支撑运营报表准确性与时效性。

  • 梳理电商运营核心数据(商品ID、订单编号、用户手机号、支付状态)的基础元数据,输出《运营数据元数据台账》(覆盖商品中心、订单系统、支付网关3个系统),用Excel搭建动态更新机制,帮助数据团队减少20%的元数据查询时间,数据提取准确率提升15%。
  • 负责运营数据日常质量检查,制定《数据质量检查清单》(含订单状态与支付状态匹配、用户手机号格式正确、商品价格非负等10条规则),每天抽查1万条数据,每周生成《数据质量周报》并推动业务部门修复问题数据,月度数据错误率从0.3%降至0.1%,运营报表的错误投诉量减少50%。
  • 对接市场部、运营部的data需求,比如市场部需要用户地域分布数据,协助数据团队确认数据来源(用户注册时的身份证前两位)、统计口径(按省级行政区划分)及更新频率(每日凌晨同步),确保需求交付的准确性,业务部门满意度从80%提升至90%。
  • 协助搭建数据质量监控雏形,用SQL编写简单的数据校验脚本(比如检查订单金额是否为负),对接定时任务工具(Airflow)实现每日自动运行,输出异常数据清单,将人工检查时间从4小时缩短至30分钟,提升团队工作效率。
项目经验
2022.03 - 2023.08
星途互动(北京)科技有限公司
大数据开发负责人

星途社区用户行为深度分析平台研发

  • 星途社区作为千万级MAU的UGC内容平台,原有用户行为分析系统存在三大痛点:实时性不足(离线T+1、实时链路延迟超5分钟)、多端(APP/小程序/Web)数据Schema不统一、无法支撑用户行为路径关联分析,导致运营决策滞后、推荐系统无法利用实时行为优化。我的核心职责是主导平台从0到1的架构设计与落地,对齐“实时洞察+深度归因”的业务目标,构建“实时+离线”一体化的用户行为分析能力。
  • 项目面临三重技术挑战:1)多源异构数据的实时同步与标准化——不同端的用户行为事件定义混乱(如APP的“点赞”与小程序的“喜欢”字段不一致),且原有Kafka消息格式无规范;2)实时计算的低延迟与高吞吐矛盾——原有Spark Streaming处理10万TPS数据时延迟超5分钟,无法满足实时运营的即时反馈需求;3)用户行为路径的深度挖掘——传统SQL无法高效处理“点击→收藏→分享→转化”的长链路关系,难以支撑运营找高价值路径。
  • 针对Schema混乱问题,我牵头梳理全端20+核心用户行为事件(如“视频完播”“商品点击”“评论互动”),制定标准化字段规范,通过Flink CDC同步业务库变更,结合Kafka Connect实现多端数据的清洗、转换与统一入湖;对于实时延迟,将计算引擎从Spark Streaming迁移至Flink,优化Checkpoint策略(启用增量检查点+调整间隔至30秒),将延迟压降至30秒内;针对路径分析,设计“用户-内容”双节点图模型,用Flink实时将行为事件写入Neo4j图数据库,支撑秒级查询用户转化路径。
  • 平台上线后,实时分析延迟从5分钟降至30秒,离线分析周期从T+1缩短至小时级,可支撑10万+TPS的用户行为数据处理。业务价值显著:运营团队基于实时路径分析优化活动策略,转化率提升25%;个性化推荐系统接入实时行为数据后,点击率提升18%,月均用户留存率提升8%。我个人主导了平台核心架构设计与多源数据整合,解决了实时性与深度分析的核心矛盾,成为团队在用户行为领域的关键技术负责人。
2020.07 - 2021.12
星途互动(北京)科技有限公司
大数据开发工程师

星途短视频内容分发大数据Pipeline重构

  • 随着公司短视频业务从100万DAU增长至500万DAU,原有内容分发数据Pipeline基于Storm构建,存在耦合度高(计算、存储、监控模块混杂)、扩展性差(新内容类型如直播切片接入需修改核心代码)、数据质量无保障(下游每周因字段缺失/错误报错2次)等问题,严重制约新业务上线速度。我的职责是负责Pipeline核心模块重构,提升系统可扩展性与数据可靠性,支撑直播、短剧等新业务快速落地。
  • 项目挑战集中在三点:1)Storm框架的维护成本高——复杂逻辑需编写Java代码,迭代周期长;2)元数据管理混乱——不同内容类型的标签、分发渠道字段无统一标准,导致调度逻辑复杂;3)数据质量失控——缺乏实时校验,下游应用频繁因脏数据故障。
  • 重构中,我将原有Pipeline拆解为“采集-清洗-转换-存储”四个通用组件:用Spark Structured Streaming替代Storm,利用其声明式API与端到端Exactly-Once语义,降低维护成本;引入Apache Atlas作为元数据管理系统,定义覆盖“内容ID、类型、标签、分发渠道”的统一模型,新内容类型只需配置元数据即可接入;搭建基于Flink的数据质量监控系统,实时校验10+核心规则(如“视频时长≥10秒”“标签非空”),异常数据拦截并报警,同时写入隔离区排查。
  • 重构后,Pipeline扩展性提升50%,新内容类型接入时间从1周缩短至1天,数据错误率从8%降至1%以下,下游故障率几乎清零。业务层面,支撑直播业务快速上线,直播内容分发效率提升40%,播放量占比从10%增长至30%。我个人完成了核心组件的解耦与元数据体系搭建,解决了原有系统的耦合性问题,为后续业务规模化扩展奠定了基础。
奖项荣誉
  • 信息系统管理工程师(中级)
  • 2022年度公司数据治理项目攻坚奖
  • 2023年公司优秀技术员工
技能特长
沟通能力
执行能力
热情坦诚
文案能力
自我评价
  • 深耕互联网数据治理,聚焦业务场景下数据质量闭环与合规落地,以业务目标牵引治理动作,拒绝被动响应。
  • 具备业务语言转译能力,能对齐技术、产品、运营诉求,推动治理方案贴合业务实际。
  • 坚持“预防式治理”思维,构建可复用框架应对业务快速迭代的数据风险,提效且可持续。
  • 将治理与业务增长绑定,通过优化数据质量支撑精准运营等场景,挖掘数据资产价值。
智能诊断
编写灵感
请选择需要查找的灵感类型
请选择灵感源泉
选择合适的内容插入后即可编辑调整
请在上方选择您需要获取的灵感类型
对话框
提示
说明