系规第8章:数据资源规划完整学习笔记
学习目标
数据资源规划不是列一张数据库清单,而是先弄清业务需要什么数据、数据之间是什么关系、怎样形成稳定模型,再用架构、标准、治理、质量和安全把数据真正管理起来。本文按教材8.1—8.5逐节展开。
这是“系规学习”的第5期。第8章内容多、清单多、方法相似,是综合、案例、论文都很重要的一章。学习主线是:三种规划方法解决“如何规划”,数据架构解决“如何组织”,标准化解决“如何统一”,数据管理解决“如何长期管好”。
本章地图:方法、架构、标准、管理
第8章由五部分组成:
- 8.1 概述:认识数据、数据资源和数据资源规划。
- 8.2 数据资源规划方法:稳定信息过程、稳定信息结构、指标能力三种方法。
- 8.3 数据架构:数据模型、数据流、传统与现代架构。
- 8.4 数据标准化:标准体系、元数据、数据元、分类与编码。
- 8.5 数据管理:数据治理、数据质量和数据安全。

本章四个核心问题
- 业务相对稳定、经常变化或面向决策时,分别应选什么规划方法?
- 数据仓库、分布式架构、数据湖和云原生架构各解决什么问题?
- 元数据、数据元、分类编码为什么是共享交换的基础?
- 治理、质量、安全三者如何配合,让数据从“资源”变成“资产”?
三门考试重点
- 综合题:三种方法适用场景与步骤、CAP、数据湖、分类编码原则、质量和安全清单。
- 案例题:根据场景选择规划方法,识别数据孤岛、标准不一、质量低、安全失控等问题。
- 论文:数据资源规划、数据治理、数据标准化、数据质量提升均可作为主线或关键措施。
8.1 概述与方法选择:先判断问题属于哪一类
8.1.1 数据、数据资源与数据资产
数据是对事实、概念或指令的一种形式化表示,可供人工或自动方式通信、解释和处理。单个数据不一定直接产生价值,只有经过组织、关联、解释和使用,才能形成信息与知识。
数据资源是可供组织利用的数据集合及其相关管理、技术和服务能力。它具有可复制、可共享、可加工、价值随使用而释放等特点,但也存在质量、安全、权属和合规约束。
数据资产更强调数据已经被组织有效控制,能够带来当前或未来价值。换句话说,数据资源是可利用的基础,数据资产是被治理并能创造价值的资源。
8.1.2 数据资源规划的作用
科学的数据资源规划可以:
- 提质增效,减少无效采集和重复建设
- 缓解数据孤岛,促进跨系统、跨部门整合
- 推动标准化、共享和共用
- 支撑数据分析、决策、创新和数据流通
- 明确建设目标、步骤、责任和长期管理机制。
规划的第一步不是建平台,而是全面调查组织的数据资源和业务活动,形成建设方案、步骤与目标。
8.1.3 三种方法怎么选
| 方法 | 适用场景 | 数据积累 | 主要优点 | 主要局限 |
|---|---|---|---|---|
| 基于稳定信息过程 | 业务场景相对固定 | 较少 | 理论成熟、易理解、实现难度较低 | 步骤繁杂、因素多、依赖过程稳定 |
| 基于稳定信息结构 | 业务过程经常变化 | 较多 | 周期较短、数据模型稳定、弱化对现行流程依赖 | 初期工作量大、全局设计后置、并行组织难 |
| 基于指标能力 | 涉及评价和决策 | 较少 | 直接支撑决策、方向清晰、数据稳定 | 案例少、实施难、对人员能力要求高 |

快速判断:
- 题干强调“业务稳定、从业务流程出发”——选稳定信息过程。
- 题干强调“政策或流程经常变、已有大量数据”——选稳定信息结构。
- 题干强调“考核、评价、驾驶舱、辅助决策”——选指标能力。
8.2 三种规划方法:过程、结构与指标
8.2.1 基于稳定信息过程的方法
该方法把需求分析与系统建模结合起来,先按工作内容而非现有部门划分职能域,再分析业务和数据,建立功能模型、数据模型和关联模型。它可概括为:
- 两条主线:业务分析、数据分析
- 三种模型:功能模型、数据模型、关联模型
- 一套标准:数据资源管理基础标准。
七项建模核心
- 定义职能域
- 各职能域业务分析,形成“职能域—业务过程—业务活动”三层业务模型
- 各职能域数据分析,弄清内外部数据流
- 建立数据元素、分类编码、用户视图、概念和逻辑数据库等基础标准
- 建立“子系统—功能模块—程序模块”三层功能模型
- 建立各子系统和全域数据模型,基本表达到第三范式
- 建立功能与数据的关联模型,解决建设顺序和共享数据库共建问题。
十一个实施步骤
- 可行性分析:研究资源、操作和技术可行性。
- 确定目标和范围:既避免范围过宽,也避免遗漏关键内容。
- 准备:组建由高层挂帅的规划小组,确定技术路线并培训人员。
- 业务活动研究:详细理解当前业务活动与信息需求。
- 建立业务逻辑模型:抽象稳定、规范的业务逻辑。
- 导出并建立数据模型:从业务活动中识别实体、关系和数据结构。
- 建立管理标准:形成数据元素、分类编码等统一规则。
- 设计主题数据库:面向业务主题整合和共享数据。
- 数据分布分析:明确数据产生、使用、存储和共享位置。
- 制定方案:整合业务模型、数据模型、标准、主题库和分布方案。
- 审核、评价方案:组织评审并根据意见迭代。
记忆骨架:可、目、准、业、业模、数模、标、库、布、案、审。
容易犯的错误
- 直接按现有部门切分职能域,固化组织壁垒
- 只访谈领导、不研究真实业务活动和数据流
- 先定系统功能,后补数据模型,导致重复库和接口泛滥
- 只有编码表,没有责任人、维护流程和标准执行机制
- 主题数据库仍按原系统复制,未形成统一主题。
8.2.2 基于稳定信息结构的方法
该方法从组织目标和任务出发,尽量全面收集数据,通过数据项、主题、功能和任务审查形成稳定的核心数据集,再转换为满足用户需要的目标数据集。它从“信息及其关系”反推业务过程,因此比流程本身更稳定。
五个步骤:
- 确定目标与系统边界
- 获取初始数据集:尽量全面,允许早期数据冗余、关系不清和不规范
- 建立核心数据集
- 完善目标数据集:由核心数据集变换得到,充分体现用户展示和使用需求
- 建立信息模型。
建立核心数据集要经过五类审查:
- 数据项审查
- 主题审查
- 功能审查
- 任务审查
- 核心数据集审查。
其中功能是对数据进行操作的静态条件,任务是多个功能的动态组合。任一步骤发现完整性或一致性问题,都可以返回前面步骤,因此它是循环迭代过程。
8.2.3 基于指标能力的方法
该方法以“决策—指标—数据模型”为切入点,从能力评价和决策需要反推指标,再从底层指标反推所需数据集。
主要步骤:
- 决策评估收集
- 支撑指标分析
- 指标体系构建
- 建立指标数据模型并分析数据集
- 数据子集融合
- 核心数据集一致性检验
- 核心数据集评价
- 按决策分析需求完善目标数据集。
核心数据集可从四个维度评价:
- 准备级:规章制度、行为准则、标准规范
- 平台级:生成、收集、工具、展示、传播和反馈
- 数据级:数量、质量、标准和范围
- 利用级:利用促进、成果产出和应用效果。
该方法最关键的是建立正确的指标体系。指标错了,数据越精确,决策反而可能越偏。
三种方法的共同底线
无论选哪种方法,都应做到:
- 目标、范围和边界清楚
- 业务人员、数据人员和技术人员共同参与
- 数据定义、来源、责任和使用场景可追溯
- 模型和标准经过审核
- 允许迭代,不能把一次规划当成永久答案。
8.3 数据架构:让数据可存、可流、可用、可演进
8.3.1 定义、构件和职责
数据架构的主要目标是有效管理数据,以及有效管理存储和使用数据的系统。主要构件包括:
- 当前状态描述
- 数据需求定义
- 数据整合指引
- 数据管控策略要求的数据资产管理规范。
组织的数据架构至少应包含数据模型和数据流设计。其职责包括把业务需求转换为数据与应用需求、管理复杂数据并在企业内传递、保持业务与IT一致,以及支撑改革转型。
8.3.2 数据模型与数据流
企业数据模型是描述组织数据实体、关系、规则和属性的高层框架。构建方式包括:
- 自上而下:从主题域开始逐层细化
- 自下而上:从已有逻辑模型向上抽象
- 实践中通常两者结合,并由利益相关方审核。
数据流描述数据的起源、存储、使用和跨流程、跨系统转换。完整记录称为数据血缘。常用表现形式:
- 二维矩阵:适合展示复杂的创建与使用关系
- 数据流图:直观展示流向,可逐层细化。
8.3.3 架构演化的驱动因素
数据架构并非一次设计永久不变,主要受以下因素推动:
- 技术发展与进步
- 业务量快速增长
- 业务需求变化
- 法律法规变化。
8.3.4 传统数据架构与CAP
数据仓库是面向主题、集成、用于分析的数据架构。传统架构可采用集中式或分布式:
- 集中式便于统一控制、标准和分析,但可能出现扩展瓶颈和单点风险。
- 分布式把数据和处理分散到多个节点,扩展性、容错能力更好,但一致性和运维更复杂。
CAP分别表示:
- C,一致性:不同副本在同一时刻看到相同数据
- A,可用性:部分节点故障后系统仍能响应请求
- P,分区容错性:网络分区发生时系统仍能继续工作。
教材口径:CAP不能三者同时完全满足,只能在AP、CP、CA中选择。案例选择时:
- 对一致性要求极高、可接受部分请求失败:偏CP
- 对持续可用要求高、可接受最终一致:偏AP
- 不考虑网络分区的单体或高度可靠局部环境才讨论CA。
8.3.5 现代数据架构
数据湖
数据湖集中存储大量结构化、半结构化和非结构化数据,可以保留原始格式,再按报告、可视化、分析和机器学习需要加工。
优势是扩展性和灵活性强,但如果没有目录、元数据、质量、权限和生命周期管理,容易变成“数据沼泽”。治理初始工作包括:
- 记录业务案例和收益衡量方式
- 明确角色与责任
- 建立质量、安全和生命周期规则
- 构建数据目录,帮助用户发现、理解和使用数据。
云原生数据架构
云原生数据架构利用云计算、容器、微服务、无服务器、多云数据管道、流处理和分布式存储,实现高扩展、高可用、高安全、高性能和高效率。其价值不在“使用云产品”,而在按业务负载弹性组合数据能力。
8.4 数据标准化:共享之前先统一语言
8.4.1 数据标准体系
数据标准体系通常包含:
- 指导类标准:标准体系、参考模型、指南、概念术语、一致性测试
- 数据类标准:元数据、分类编码、数据内容
- 还应结合管理、技术、交换和安全等配套标准形成执行体系。
标准必须有定义、有责任人、有审批发布、有版本、有落地检查。只有文档而没有执行机制,不算真正标准化。
8.4.2 元数据与数据元
- 元数据是描述数据的数据,用来说明数据名称、含义、结构、来源、责任、格式和使用规则。
- 数据元是用一组属性规定其定义、标识、表示和允许值的数据单元,是数据标准化的基本单元。
元数据帮助“找到并理解数据”,数据元帮助“让同一概念在不同系统中一致表达”。两者共同支撑目录、交换、血缘、质量和治理。
8.4.3 数据分类五原则
- 稳定性:选择最稳定、最本质的分类特征
- 系统性:按内在规律形成层次清晰、结构合理的体系
- 可扩充性:预留类目和层级空间
- 综合实用性:从实际需求出发,便于使用和操作
- 兼容性:优先遵循国家、行业和相关国际标准。
口诀:稳、系、扩、实、兼。
8.4.4 数据编码四原则
- 唯一性:一物一码、一码一物
- 匹配性:代码结构与分类体系匹配
- 可扩充性:保留后备容量
- 简洁性:结构简单、长度适当,降低存储和差错成本。
口诀:唯、配、扩、简。这些原则可能冲突,例如扩展空间越大,编码往往越不简洁,因此需要综合优化。
8.5 数据管理:治理定规则,质量保可用,安全控风险

8.5.1 数据治理
数据治理是在管理数据资产过程中行使权力和管控,包括计划、监控和实施。它负责制定决策机制、制度、流程、职责和监督方式,确保数据被恰当地管理;数据管理则在执行层面具体管理数据。
一句话区分:治理决定谁按什么规则做决定,管理负责把规则落实到数据生命周期。
数据治理的目标是把数据作为资产管理,提供治理原则、制度、流程、框架和指标,并监督数据资产管理。成功治理应明确:
- 治理什么
- 怎样治理
- 谁来执行和负责
- 如何监控、衡量和持续改进。
建设治理机制时要获得业务战略支持,制定章程,建立组织和职责,为可持续运营制订计划,并把治理控制点嵌入系统与数据生命周期。
8.5.2 数据质量
低质量数据带来成本和风险。质量管理必须贯穿整个生命周期,并优先关注对组织和客户最重要的数据。
三项目标:
- 根据数据消费者需要,以受管理方式使数据符合要求
- 定义贯穿生命周期的数据质量标准和控制规范
- 建立测量、监控和报告质量水平的过程。
十项原则:
- 重要性
- 全生命周期管理
- 预防
- 根因修正
- 治理
- 标准驱动
- 客观测量和透明度
- 嵌入业务流程
- 系统强制执行
- 与服务水平关联。
七类活动:
- 定义高质量数据
- 定义数据质量战略
- 识别关键数据和业务规则
- 执行初始数据质量评估
- 识别改进方向并确定优先级
- 定义数据质量改进目标
- 开发和部署数据质量操作。
案例中不要只写“清洗数据”。应从标准、采集源头、责任、规则校验、监控指标、问题闭环和根因预防共同改进。
8.5.3 数据安全
数据安全通过策略和过程的规划、建立与执行,为数据资产提供正确的身份验证、授权、访问和审计。
安全要求来源包括:
- 利益相关方
- 政府法规
- 特定业务关注点
- 合法访问需求
- 合同义务。
三项目标:
- 支持适当访问并防止不当访问
- 遵从隐私保护和保密制度、法规
- 满足利益相关方对隐私和保密的要求。
六项指导原则:
- 协同合作
- 企业统筹
- 主动管理
- 明确责任
- 元数据驱动
- 减少接触以降低风险。
主要活动包括识别安全需求、制定制度和细则、评估当前风险、实施控制与流程,并审核安全措施的有效性。
三门考试怎么用
综合题
重点识别:
- 三种规划方法的场景、优缺点和步骤
- 稳定信息过程的“两线三模一标”
- 稳定信息结构五步和五种审查
- 指标能力的“决策—指标—数据模型”
- CAP与数据湖
- 分类五原则、编码四原则
- 质量十原则、安全六原则。
案例题
遇到数据问题,可按四个维度回答:
- 规划方法:场景和方法是否匹配,范围、模型、标准是否完整
- 数据架构:模型、数据流、血缘、存储和集成是否合理
- 数据治理与质量:职责、标准、目录、规则、指标和问题闭环是否健全
- 数据安全:分类分级、最小权限、加密、脱敏、审计、备份和合规是否落实。
答案使用“现象—原因—措施—效果”组织。例如:同一客户在多个系统编码不同,根因是缺少统一数据元和编码标准;应建立主数据与编码标准,明确责任人并在采集接口实施强校验,从源头减少重复和冲突。
论文
可以按“背景问题—规划目标—方法选择—业务与数据调研—数据模型和标准—架构平台—治理质量安全—实施路线—成效与改进”展开。论文不能只写建湖、建仓、上平台,必须说明治理组织、标准和质量安全如何保障平台产生价值。
闭卷自测
- 三种数据资源规划方法各适合什么场景?
- 稳定信息过程方法的“两条主线、三种模型、一套标准”是什么?
- 稳定信息过程方法十一个步骤是什么?
- 稳定信息结构方法五步和核心数据集五种审查是什么?
- 指标能力方法的主线和核心步骤是什么?
- 数据架构至少包含什么?数据血缘是什么?
- CAP三项分别是什么,AP与CP如何选择?
- 数据分类五原则、编码四原则是什么?
- 如何区分数据治理和数据管理?
- 数据质量十原则、数据安全六项指导原则是什么?
写在最后
第8章的稳定骨架是:
三种方法选路线,数据架构搭骨架,数据标准统一语言,治理质量安全保障长期价值。
第一轮先掌握方法选择、两线三模一标、结构法五步、CAP、分类编码和治理质量安全清单;第二轮再补三种方法的细节步骤、传统与现代架构以及各项管理活动。
我是陈文茂,正在用自己的方式重新整理系统规划与管理师学习资料。
如果这篇对你有帮助,欢迎点赞、在看、转发。