系规第8章:数据资源规划完整学习笔记

学习目标

数据资源规划不是列一张数据库清单,而是先弄清业务需要什么数据、数据之间是什么关系、怎样形成稳定模型,再用架构、标准、治理、质量和安全把数据真正管理起来。本文按教材8.1—8.5逐节展开。

这是“系规学习”的第5期。第8章内容多、清单多、方法相似,是综合、案例、论文都很重要的一章。学习主线是:三种规划方法解决“如何规划”,数据架构解决“如何组织”,标准化解决“如何统一”,数据管理解决“如何长期管好”。

本章地图:方法、架构、标准、管理

第8章由五部分组成

  1. 8.1 概述:认识数据、数据资源和数据资源规划。
  2. 8.2 数据资源规划方法:稳定信息过程、稳定信息结构、指标能力三种方法。
  3. 8.3 数据架构:数据模型、数据流、传统与现代架构。
  4. 8.4 数据标准化:标准体系、元数据、数据元、分类与编码。
  5. 8.5 数据管理:数据治理、数据质量和数据安全。

第8章数据资源规划学习地图

本章四个核心问题

  • 业务相对稳定、经常变化或面向决策时,分别应选什么规划方法?
  • 数据仓库、分布式架构、数据湖和云原生架构各解决什么问题?
  • 元数据、数据元、分类编码为什么是共享交换的基础?
  • 治理、质量、安全三者如何配合,让数据从“资源”变成“资产”?

三门考试重点

  • 综合题:三种方法适用场景与步骤、CAP、数据湖、分类编码原则、质量和安全清单。
  • 案例题:根据场景选择规划方法,识别数据孤岛、标准不一、质量低、安全失控等问题。
  • 论文:数据资源规划、数据治理、数据标准化、数据质量提升均可作为主线或关键措施。

8.1 概述与方法选择:先判断问题属于哪一类

8.1.1 数据、数据资源与数据资产

数据是对事实、概念或指令的一种形式化表示,可供人工或自动方式通信、解释和处理。单个数据不一定直接产生价值,只有经过组织、关联、解释和使用,才能形成信息与知识。

数据资源是可供组织利用的数据集合及其相关管理、技术和服务能力。它具有可复制、可共享、可加工、价值随使用而释放等特点,但也存在质量、安全、权属和合规约束。

数据资产更强调数据已经被组织有效控制,能够带来当前或未来价值。换句话说,数据资源是可利用的基础,数据资产是被治理并能创造价值的资源。

8.1.2 数据资源规划的作用

科学的数据资源规划可以

  • 提质增效,减少无效采集和重复建设
  • 缓解数据孤岛,促进跨系统、跨部门整合
  • 推动标准化、共享和共用
  • 支撑数据分析、决策、创新和数据流通
  • 明确建设目标、步骤、责任和长期管理机制。

规划的第一步不是建平台,而是全面调查组织的数据资源和业务活动,形成建设方案、步骤与目标。

8.1.3 三种方法怎么选

方法 适用场景 数据积累 主要优点 主要局限
基于稳定信息过程 业务场景相对固定 较少 理论成熟、易理解、实现难度较低 步骤繁杂、因素多、依赖过程稳定
基于稳定信息结构 业务过程经常变化 较多 周期较短、数据模型稳定、弱化对现行流程依赖 初期工作量大、全局设计后置、并行组织难
基于指标能力 涉及评价和决策 较少 直接支撑决策、方向清晰、数据稳定 案例少、实施难、对人员能力要求高

三种数据资源规划方法

快速判断

  • 题干强调“业务稳定、从业务流程出发”——选稳定信息过程。
  • 题干强调“政策或流程经常变、已有大量数据”——选稳定信息结构。
  • 题干强调“考核、评价、驾驶舱、辅助决策”——选指标能力。

8.2 三种规划方法:过程、结构与指标

8.2.1 基于稳定信息过程的方法

该方法把需求分析与系统建模结合起来,先按工作内容而非现有部门划分职能域,再分析业务和数据,建立功能模型、数据模型和关联模型。它可概括为:

  • 两条主线:业务分析、数据分析
  • 三种模型:功能模型、数据模型、关联模型
  • 一套标准:数据资源管理基础标准。

七项建模核心

  1. 定义职能域
  2. 各职能域业务分析,形成“职能域—业务过程—业务活动”三层业务模型
  3. 各职能域数据分析,弄清内外部数据流
  4. 建立数据元素、分类编码、用户视图、概念和逻辑数据库等基础标准
  5. 建立“子系统—功能模块—程序模块”三层功能模型
  6. 建立各子系统和全域数据模型,基本表达到第三范式
  7. 建立功能与数据的关联模型,解决建设顺序和共享数据库共建问题。

十一个实施步骤

  1. 可行性分析:研究资源、操作和技术可行性。
  2. 确定目标和范围:既避免范围过宽,也避免遗漏关键内容。
  3. 准备:组建由高层挂帅的规划小组,确定技术路线并培训人员。
  4. 业务活动研究:详细理解当前业务活动与信息需求。
  5. 建立业务逻辑模型:抽象稳定、规范的业务逻辑。
  6. 导出并建立数据模型:从业务活动中识别实体、关系和数据结构。
  7. 建立管理标准:形成数据元素、分类编码等统一规则。
  8. 设计主题数据库:面向业务主题整合和共享数据。
  9. 数据分布分析:明确数据产生、使用、存储和共享位置。
  10. 制定方案:整合业务模型、数据模型、标准、主题库和分布方案。
  11. 审核、评价方案:组织评审并根据意见迭代。

记忆骨架:可、目、准、业、业模、数模、标、库、布、案、审。

容易犯的错误

  • 直接按现有部门切分职能域,固化组织壁垒
  • 只访谈领导、不研究真实业务活动和数据流
  • 先定系统功能,后补数据模型,导致重复库和接口泛滥
  • 只有编码表,没有责任人、维护流程和标准执行机制
  • 主题数据库仍按原系统复制,未形成统一主题。

8.2.2 基于稳定信息结构的方法

该方法从组织目标和任务出发,尽量全面收集数据,通过数据项、主题、功能和任务审查形成稳定的核心数据集,再转换为满足用户需要的目标数据集。它从“信息及其关系”反推业务过程,因此比流程本身更稳定。

五个步骤

  1. 确定目标与系统边界
  2. 获取初始数据集:尽量全面,允许早期数据冗余、关系不清和不规范
  3. 建立核心数据集
  4. 完善目标数据集:由核心数据集变换得到,充分体现用户展示和使用需求
  5. 建立信息模型。

建立核心数据集要经过五类审查:

  • 数据项审查
  • 主题审查
  • 功能审查
  • 任务审查
  • 核心数据集审查。

其中功能是对数据进行操作的静态条件,任务是多个功能的动态组合。任一步骤发现完整性或一致性问题,都可以返回前面步骤,因此它是循环迭代过程。

8.2.3 基于指标能力的方法

该方法以“决策—指标—数据模型”为切入点,从能力评价和决策需要反推指标,再从底层指标反推所需数据集。

主要步骤

  1. 决策评估收集
  2. 支撑指标分析
  3. 指标体系构建
  4. 建立指标数据模型并分析数据集
  5. 数据子集融合
  6. 核心数据集一致性检验
  7. 核心数据集评价
  8. 按决策分析需求完善目标数据集。

核心数据集可从四个维度评价:

  • 准备级:规章制度、行为准则、标准规范
  • 平台级:生成、收集、工具、展示、传播和反馈
  • 数据级:数量、质量、标准和范围
  • 利用级:利用促进、成果产出和应用效果。

该方法最关键的是建立正确的指标体系。指标错了,数据越精确,决策反而可能越偏。

三种方法的共同底线

无论选哪种方法,都应做到

  • 目标、范围和边界清楚
  • 业务人员、数据人员和技术人员共同参与
  • 数据定义、来源、责任和使用场景可追溯
  • 模型和标准经过审核
  • 允许迭代,不能把一次规划当成永久答案。

8.3 数据架构:让数据可存、可流、可用、可演进

8.3.1 定义、构件和职责

数据架构的主要目标是有效管理数据,以及有效管理存储和使用数据的系统。主要构件包括:

  • 当前状态描述
  • 数据需求定义
  • 数据整合指引
  • 数据管控策略要求的数据资产管理规范。

组织的数据架构至少应包含数据模型和数据流设计。其职责包括把业务需求转换为数据与应用需求、管理复杂数据并在企业内传递、保持业务与IT一致,以及支撑改革转型。

8.3.2 数据模型与数据流

企业数据模型是描述组织数据实体、关系、规则和属性的高层框架。构建方式包括:

  • 自上而下:从主题域开始逐层细化
  • 自下而上:从已有逻辑模型向上抽象
  • 实践中通常两者结合,并由利益相关方审核。

数据流描述数据的起源、存储、使用和跨流程、跨系统转换。完整记录称为数据血缘。常用表现形式:

  • 二维矩阵:适合展示复杂的创建与使用关系
  • 数据流图:直观展示流向,可逐层细化。

8.3.3 架构演化的驱动因素

数据架构并非一次设计永久不变,主要受以下因素推动:

  • 技术发展与进步
  • 业务量快速增长
  • 业务需求变化
  • 法律法规变化。

8.3.4 传统数据架构与CAP

数据仓库是面向主题、集成、用于分析的数据架构。传统架构可采用集中式或分布式:

  • 集中式便于统一控制、标准和分析,但可能出现扩展瓶颈和单点风险。
  • 分布式把数据和处理分散到多个节点,扩展性、容错能力更好,但一致性和运维更复杂。

CAP分别表示

  • C,一致性:不同副本在同一时刻看到相同数据
  • A,可用性:部分节点故障后系统仍能响应请求
  • P,分区容错性:网络分区发生时系统仍能继续工作。

教材口径:CAP不能三者同时完全满足,只能在AP、CP、CA中选择。案例选择时:

  • 对一致性要求极高、可接受部分请求失败:偏CP
  • 对持续可用要求高、可接受最终一致:偏AP
  • 不考虑网络分区的单体或高度可靠局部环境才讨论CA。

8.3.5 现代数据架构

数据湖

数据湖集中存储大量结构化、半结构化和非结构化数据,可以保留原始格式,再按报告、可视化、分析和机器学习需要加工。

优势是扩展性和灵活性强,但如果没有目录、元数据、质量、权限和生命周期管理,容易变成“数据沼泽”。治理初始工作包括:

  • 记录业务案例和收益衡量方式
  • 明确角色与责任
  • 建立质量、安全和生命周期规则
  • 构建数据目录,帮助用户发现、理解和使用数据。

云原生数据架构

云原生数据架构利用云计算、容器、微服务、无服务器、多云数据管道、流处理和分布式存储,实现高扩展、高可用、高安全、高性能和高效率。其价值不在“使用云产品”,而在按业务负载弹性组合数据能力。

8.4 数据标准化:共享之前先统一语言

8.4.1 数据标准体系

数据标准体系通常包含

  • 指导类标准:标准体系、参考模型、指南、概念术语、一致性测试
  • 数据类标准:元数据、分类编码、数据内容
  • 还应结合管理、技术、交换和安全等配套标准形成执行体系。

标准必须有定义、有责任人、有审批发布、有版本、有落地检查。只有文档而没有执行机制,不算真正标准化。

8.4.2 元数据与数据元

  • 元数据是描述数据的数据,用来说明数据名称、含义、结构、来源、责任、格式和使用规则。
  • 数据元是用一组属性规定其定义、标识、表示和允许值的数据单元,是数据标准化的基本单元。

元数据帮助“找到并理解数据”,数据元帮助“让同一概念在不同系统中一致表达”。两者共同支撑目录、交换、血缘、质量和治理。

8.4.3 数据分类五原则

  1. 稳定性:选择最稳定、最本质的分类特征
  2. 系统性:按内在规律形成层次清晰、结构合理的体系
  3. 可扩充性:预留类目和层级空间
  4. 综合实用性:从实际需求出发,便于使用和操作
  5. 兼容性:优先遵循国家、行业和相关国际标准。

口诀:稳、系、扩、实、兼。

8.4.4 数据编码四原则

  1. 唯一性:一物一码、一码一物
  2. 匹配性:代码结构与分类体系匹配
  3. 可扩充性:保留后备容量
  4. 简洁性:结构简单、长度适当,降低存储和差错成本。

口诀:唯、配、扩、简。这些原则可能冲突,例如扩展空间越大,编码往往越不简洁,因此需要综合优化。

8.5 数据管理:治理定规则,质量保可用,安全控风险

数据治理质量安全关系

8.5.1 数据治理

数据治理是在管理数据资产过程中行使权力和管控,包括计划、监控和实施。它负责制定决策机制、制度、流程、职责和监督方式,确保数据被恰当地管理;数据管理则在执行层面具体管理数据。

一句话区分:治理决定谁按什么规则做决定,管理负责把规则落实到数据生命周期。

数据治理的目标是把数据作为资产管理,提供治理原则、制度、流程、框架和指标,并监督数据资产管理。成功治理应明确:

  • 治理什么
  • 怎样治理
  • 谁来执行和负责
  • 如何监控、衡量和持续改进。

建设治理机制时要获得业务战略支持,制定章程,建立组织和职责,为可持续运营制订计划,并把治理控制点嵌入系统与数据生命周期。

8.5.2 数据质量

低质量数据带来成本和风险。质量管理必须贯穿整个生命周期,并优先关注对组织和客户最重要的数据。

三项目标

  1. 根据数据消费者需要,以受管理方式使数据符合要求
  2. 定义贯穿生命周期的数据质量标准和控制规范
  3. 建立测量、监控和报告质量水平的过程。

十项原则

  1. 重要性
  2. 全生命周期管理
  3. 预防
  4. 根因修正
  5. 治理
  6. 标准驱动
  7. 客观测量和透明度
  8. 嵌入业务流程
  9. 系统强制执行
  10. 与服务水平关联。

七类活动

  1. 定义高质量数据
  2. 定义数据质量战略
  3. 识别关键数据和业务规则
  4. 执行初始数据质量评估
  5. 识别改进方向并确定优先级
  6. 定义数据质量改进目标
  7. 开发和部署数据质量操作。

案例中不要只写“清洗数据”。应从标准、采集源头、责任、规则校验、监控指标、问题闭环和根因预防共同改进。

8.5.3 数据安全

数据安全通过策略和过程的规划、建立与执行,为数据资产提供正确的身份验证、授权、访问和审计。

安全要求来源包括

  • 利益相关方
  • 政府法规
  • 特定业务关注点
  • 合法访问需求
  • 合同义务。

三项目标

  1. 支持适当访问并防止不当访问
  2. 遵从隐私保护和保密制度、法规
  3. 满足利益相关方对隐私和保密的要求。

六项指导原则

  1. 协同合作
  2. 企业统筹
  3. 主动管理
  4. 明确责任
  5. 元数据驱动
  6. 减少接触以降低风险。

主要活动包括识别安全需求、制定制度和细则、评估当前风险、实施控制与流程,并审核安全措施的有效性。

三门考试怎么用

综合题

重点识别

  • 三种规划方法的场景、优缺点和步骤
  • 稳定信息过程的“两线三模一标”
  • 稳定信息结构五步和五种审查
  • 指标能力的“决策—指标—数据模型”
  • CAP与数据湖
  • 分类五原则、编码四原则
  • 质量十原则、安全六原则。

案例题

遇到数据问题,可按四个维度回答:

  1. 规划方法:场景和方法是否匹配,范围、模型、标准是否完整
  2. 数据架构:模型、数据流、血缘、存储和集成是否合理
  3. 数据治理与质量:职责、标准、目录、规则、指标和问题闭环是否健全
  4. 数据安全:分类分级、最小权限、加密、脱敏、审计、备份和合规是否落实。

答案使用“现象—原因—措施—效果”组织。例如:同一客户在多个系统编码不同,根因是缺少统一数据元和编码标准;应建立主数据与编码标准,明确责任人并在采集接口实施强校验,从源头减少重复和冲突。

论文

可以按“背景问题—规划目标—方法选择—业务与数据调研—数据模型和标准—架构平台—治理质量安全—实施路线—成效与改进”展开。论文不能只写建湖、建仓、上平台,必须说明治理组织、标准和质量安全如何保障平台产生价值。

闭卷自测

  1. 三种数据资源规划方法各适合什么场景?
  2. 稳定信息过程方法的“两条主线、三种模型、一套标准”是什么?
  3. 稳定信息过程方法十一个步骤是什么?
  4. 稳定信息结构方法五步和核心数据集五种审查是什么?
  5. 指标能力方法的主线和核心步骤是什么?
  6. 数据架构至少包含什么?数据血缘是什么?
  7. CAP三项分别是什么,AP与CP如何选择?
  8. 数据分类五原则、编码四原则是什么?
  9. 如何区分数据治理和数据管理?
  10. 数据质量十原则、数据安全六项指导原则是什么?

写在最后

第8章的稳定骨架是

三种方法选路线,数据架构搭骨架,数据标准统一语言,治理质量安全保障长期价值。

第一轮先掌握方法选择、两线三模一标、结构法五步、CAP、分类编码和治理质量安全清单;第二轮再补三种方法的细节步骤、传统与现代架构以及各项管理活动。

我是陈文茂,正在用自己的方式重新整理系统规划与管理师学习资料。

如果这篇对你有帮助,欢迎点赞、在看、转发。


系规第8章:数据资源规划完整学习笔记
https://maoyu92.github.io/2026/07/26/07 AI笔记/软考系规/a038_系规第8章:数据资源规划完整学习笔记/
作者
陈文茂
发布于
2026年7月26日
许可协议