数仓治理:如何避免重复建表?
目录一、为什么会出现重复建表?1. 表不可见:不知道已有类似表2. 表不可信:知道有表,但不敢用3. 口径不统一:看起来是重复表,其实口径不同4. 公共层薄弱:每个需求都从明细层直接加工二、避免重复建表的核心思路三、建立统一元数据管理四、建设数据资产目录五、规范数仓分层和表命名1. 数仓分层规范ODS 层DWD 层DWS 层DIM 层ADS 层2. 表命名规范六、建表前必须先检索七、生产环境建表必须走审批建表申请应包含哪些内容?八、建立模型评审机制九、建设公共层、减少烟冲式开发十、明确表的 Owner 制度十一、统一指标口径十二、自动检测相似表1. 表名相似度检测2. 字段相似度检测3. 血缘相似度检测4. 下游使用相似度检测十三、建表流程中嵌入自动校验十四、临时表和中间表必须治理十五、存量重复表如何治理?1. 判断疑似重复表2. 无访问表治理3. 重复表合并策略策略一:保留主表,废弃副表策略二:下游迁移策略三:设置只读或停止调度策略四:正式下线十七、用 Owner 制度保证长期可维护十八、落地路线第一阶段:解决“不知道有没有表”第二阶段:解决“不能随便建表”第三阶段:解决“公共层不好用”第四阶段:解决“自动化治理”十九、总结二十、面试回答模板面试题:如何避免重复建表?其他人可能不知道已有同一张表,重复新建。在数据仓库建设过程中,重复建表是一个非常常见但又容易被忽视的问题。很多时候并不是开发人员故意重复建设,而是:不知道已经有类似的表;知道有类似的表,但不确定口径是否一致;现有表不满足当前需求,于是另起炉灶;临时表长期没人治理,逐渐变成“正式表”;各业务线独立开发,缺乏统一模型管理。最终结果是:同一个业务主题下出现大量结构相似、口径相近、来源相同的表,造成存储浪费、维护成本上升、指标口径不一致、数据资产可信度下降。本文将从问题成因、治理思路、技术机制和落地实践几个角度,聊聊数仓中如何系统性地避免重复建表。