负责公司电商大促及日常场景下的实时数据处理系统全生命周期管理,覆盖用户行为分析、实时风控决策、GMV实时看板三大核心链路,主导从需求拆解到上线运维的技术落地,保障数据流端到端延迟≤200ms、日均处理量超50亿条的稳定性。
- 主导设计实时数仓三层架构(ODS→DWD→DWS),基于Flink 1.17+SQL完成用户点击-加购-下单全链路事件流的标准化处理;针对大促期间Kafka消息乱序导致的窗口计算偏差问题,引入Watermark动态调整策略(允许5s延迟+1s乱序),结合事件时间分区键优化,将订单归因准确率从92%提升至98.6%,支撑双11期间实时GMV看板的精准性。
- 牵头优化实时风控规则引擎的数据供给链路,通过Flink CEP(复杂事件处理)实现跨3个数据源(用户设备信息、交易流水、IP黑库)的多维度关联计算;针对传统规则匹配延迟高(平均800ms)的痛点,设计状态缓存复用方案(减少30%重复状态存储)与异步IO调用外部风控库,将单条风险事件处理耗时压缩至150ms内,支撑大促期间每秒10万+风险事件的实时拦截。
- 构建实时数据质量监控体系,基于Flink Metrics扩展自定义指标(如消息积压量、窗口触发超时次数),集成Prometheus+Grafana实现分钟级告警;通过分析历史故障数据,定位到Kafka消费者拉取速率不均衡问题,优化分区分配策略(采用粘性分区+动态重平衡),将任务重启频率从每周2次降至每月0.5次,保障核心链路SLA≥99.95%。
- 推动实时计算资源效能提升,基于YARN队列动态扩缩容机制,结合业务峰谷特征(如早8点/晚8点流量波峰)设计弹性调度策略;在大促预热期将Flink作业并行度从32调整至64,同时利用Spot实例降低成本,整体资源利用率提升40%,大促期间计算成本同比下降28%。