数据仓库与指标生产链路

围绕企业数据中台建设数据抽取、明细落仓、预统计、指标结果写入和调度执行链路,覆盖收费、品质、工单、HR、研发效能等业务域。维护 DataX JSON、DWD 建表 SQL、DWS 预统计 SQL 与 Python 调度辅助工具,支撑数百级指标与大量增量、全量、预统计和压缩表任务。

这条链路决定前台可信度

用户看到的一张图,背后往往经过源表抽取、明细建模、预统计、指标写入、调度执行和服务查询。任何一层边界处理不好,最终表现都是“数据不准”。

我做这类工作的收获

它让我理解了数据产品的另一面:页面可以很漂亮,AI 可以很会说,但数据链路里的月份边界、组织归属、分子分母和失败重跑才是真正决定可信度的东西。

metric-pipeline.txttxt7 行
业务源表
  -> DataX / CDC 抽取
  -> DWD 明细层:企业 / 组织 / 项目 / 时间
  -> DWS 预统计:日 / 月 / 年 / 多组织层级
  -> 指标结果写入
  -> 调度执行与失败重跑
  -> BI 看板 / AI 问数 / 管理驾驶舱
指标开发里的高风险点
风险表现我的处理思路
时间边界月度、年度和账期口径对不上显式定义统计周期,避免散落在 SQL 条件里
组织层级集团、区域、项目汇总重复或漏算统一组织维表和汇总层级,保留可追溯字段
SQL 兼容ONLY_FULL_GROUP_BY、临时表重复引用失败形成脚本约束和高风险写法清单
失败重跑部分写入导致指标结果不一致设计批次、幂等键和写入过程检查