数据仓库与指标生产链路
围绕企业数据中台建设数据抽取、明细落仓、预统计、指标结果写入和调度执行链路,覆盖收费、品质、工单、HR、研发效能等业务域。维护 DataX JSON、DWD 建表 SQL、DWS 预统计 SQL 与 Python 调度辅助工具,支撑数百级指标与大量增量、全量、预统计和压缩表任务。
这条链路决定前台可信度
用户看到的一张图,背后往往经过源表抽取、明细建模、预统计、指标写入、调度执行和服务查询。任何一层边界处理不好,最终表现都是“数据不准”。
我做这类工作的收获
它让我理解了数据产品的另一面:页面可以很漂亮,AI 可以很会说,但数据链路里的月份边界、组织归属、分子分母和失败重跑才是真正决定可信度的东西。
业务源表
-> DataX / CDC 抽取
-> DWD 明细层:企业 / 组织 / 项目 / 时间
-> DWS 预统计:日 / 月 / 年 / 多组织层级
-> 指标结果写入
-> 调度执行与失败重跑
-> BI 看板 / AI 问数 / 管理驾驶舱| 风险 | 表现 | 我的处理思路 |
|---|---|---|
| 时间边界 | 月度、年度和账期口径对不上 | 显式定义统计周期,避免散落在 SQL 条件里 |
| 组织层级 | 集团、区域、项目汇总重复或漏算 | 统一组织维表和汇总层级,保留可追溯字段 |
| SQL 兼容 | ONLY_FULL_GROUP_BY、临时表重复引用失败 | 形成脚本约束和高风险写法清单 |
| 失败重跑 | 部分写入导致指标结果不一致 | 设计批次、幂等键和写入过程检查 |