阅读与写作指南

如何使用这本书

这本书既可以从头连续阅读,也可以把它当作一个面向项目的工具箱。连续阅读适合希望建立完整知识结构的读者:从组织变化出发,经过产品定义、参考架构和可信治理,最后进入关键决策、贯穿案例与组织运行机制。项目式阅读则可以从一个现实问题切入,例如“企业知识助手为什么回答不稳定”“是否需要实时数据”“应该用 RAG 还是语义层”“Agent 怎样继承用户权限”,再沿章节中的关联概念补齐所需能力。

无论选择哪种方式,都建议带着一个具体场景阅读。场景可以来自所在企业,也可以使用书中的“山城精工”案例。没有场景时,架构很容易变成名词之间的连线;有了任务、用户、风险和时间窗口,同一个组件才会显现出不同价值。例如向量检索在产品手册问答中可能是核心能力,在精确计算财务指标时却不应替代结构化查询;实时流处理在设备告警中可能必要,在季度客户分层中则可能只是昂贵的技术偏好。

每读完一章,读者最好回答三个问题。第一,这一章改变了我对当前问题的哪个判断?第二,我能否产出一个可评审的对象,而不是只记住概念?第三,如果把本章方法用于真实企业,最大的约束和反对意见是什么?把答案写下来,会比划重点更接近高级岗位所需的思考训练。

全书的七部分结构

第一部分回答“为什么”。它从 AI 对组织生产方式的影响出发,定义 AI-Ready Data,并建立从基础设施 Ready 到 Agent Ready 的四层能力模型。这一部分的目标不是渲染技术趋势,而是建立因果链:为什么 Agent 会提高组织对数据反馈的要求,为什么数据与上下文缺陷会转化为 AI 风险,以及不同层次的 Ready 如何相互依赖。

第二部分回答“做什么产品”。企业不能直接把“建设 AI Ready”作为产品需求,因为它没有明确用户、任务和验收结果。这一部分从场景优先级开始,把 Agent 任务翻译为数据需求,定义最小可行数据产品和指标,再规划从试点到规模化的产品路线。读者完成这一部分后,应当能写出一份不以“接入大模型”为中心,而以用户任务、数据承诺、风险和价值为中心的 PRD。

第三部分回答“怎样设计架构”。章节依次覆盖数据源与采集、处理与服务、上下文层、检索与知识组织、面向 Agent 的数据服务。架构部分采用责任分层而不是产品堆叠:每一层说明输入、输出、所有者、质量属性与失败模式。OpenMetadata 的模式和源码会作为上下文层的工程参考,帮助读者理解资产、语义、质量、血缘、契约和数据产品如何形成关系网络 (OpenMetadata Contributors, 不详)。

第四部分回答“怎样可信地运行”。质量、血缘、契约、权限、隐私、审计、评估和反馈不是上线前的合规附件,而是 AI 数据产品的组成部分。一个回答如果无法说明来自哪个版本的数据,就难以被信任;一个 Agent 如果能读到敏感字段却没有用途限制,就不是产品体验问题而是安全问题;一个系统如果只统计调用量而不记录任务是否完成,就无法证明业务价值。

第五部分回答“如何作出关键选择”。RAG、语义层、知识图谱、批处理、流处理、自研、采购和开源组合都不存在脱离场景的唯一答案。本部分使用 ADR 思路,要求读者明确背景、驱动因素、备选方案、决策和后果。高级架构能力往往不体现在知道更多方案,而体现在知道什么时候不选某个方案。

第六部分用“山城精工”案例贯穿全书。案例从业务背景和问题树开始,形成数据产品 PRD、目标架构、关键 ADR 和九十天路线。它不会假装所有细节都能一次确定,而会保留假设、风险和阶段性选择,展示项目怎样在不完整信息下逐步收敛。

第七部分讨论能力如何进入组织。AI Ready Data 不是一个项目组交付完平台后结束的任务,它需要产品负责人、数据域、平台团队、安全团队和业务团队形成稳定运行机制。最后一章把全书压缩为从一个场景开始的行动清单,帮助读者避免因体系庞大而迟迟不动。

不同角色的阅读路径

如果你是 AI 数据产品经理,可以先读第二部分,再回到第一部分补齐定义,然后阅读第四部分的评估与反馈、权限与审计,最后用第六部分完成一份完整 PRD。你的重点产物应当是:场景优先级矩阵、Agent 数据需求说明书、最小可行数据产品、指标树和路线图。阅读架构章节时,不要求掌握每项组件的实现细节,但要能够说明能力边界、依赖与非功能需求。

如果你是数据架构师或 AI 架构师,可以先读第一、三、四、五部分。你的重点不是把参考架构原样复制,而是为一个场景写出质量属性:可用性、时效、一致性、可解释性、安全、可观测性、成本和可演进性。随后用 ADR 记录为什么选择某种检索、处理或采购方案。阅读产品章节时,要特别关注价值指标与消费者体验,因为没有消费者的数据架构很容易退化为平台自我建设。

如果你是数据负责人或企业架构负责人,可以先读第一、二、五、七部分,再用成熟度评估表和案例路线图组织讨论。你需要关注的是投资顺序、跨域标准、共性平台与领域自治、风险容忍度和组织责任。参考架构中的每一层都要追问:它是企业级能力、领域能力还是场景能力?谁出预算?谁对服务等级负责?如果没有明确答案,组件上线也不会自动形成能力。

如果你是工程师,可以从第三、四部分进入,结合源码理解模式、接口和运行机制,再回到第二部分确认自己建设的能力服务于什么任务。工程实践的价值不只在于系统可运行,还在于可变更、可观测、可追溯和可运营。一个精心编写的连接器、契约校验或血缘事件,只有进入产品闭环,才能转化为企业价值。

如果你正在准备面试,建议不要按章节背诵。选择一个真实或虚构场景,依次产出场景矩阵、PRD、参考架构、三份 ADR、权限矩阵、评估计划和九十天路线,再用附录的能力映射组织表达。面试官更关心你如何在冲突约束中作决定,而不是能否说出所有技术名词。

每章的阅读模板

为保持全书一致,主体章节大体遵循六段式结构。

第一段是“问题现场”,用业务任务或失败案例说明为什么需要本章能力。第二段是“概念与边界”,给出定义,同时列出容易混淆的概念和反例。第三段是“设计方法”,把概念转换成步骤、模型、接口或责任。第四段是“架构与产品权衡”,说明替代方案、成本和适用条件。第五段是“度量与治理”,明确怎样知道能力有效、怎样发现失败。第六段是“章节产物”,给出可以进入评审的模板、清单或决策。

读者可以用同样结构审视任何新的 AI 数据概念。遇到一个新产品或新框架时,不急于问是否先进,而是问:它解决的具体问题是什么;与现有能力重叠在哪里;引入后谁维护;成功指标是什么;数据和权限边界怎样处理;退出成本多高。这个模板比追逐某个版本的功能清单更耐久。

贯穿案例的使用方式

“山城精工”是一家虚构化的中型制造企业。它拥有约两千名员工,产品销往多个区域,核心系统包括 ERP、MES、CRM、供应链协同、售后工单、设备平台和文档库。企业计划建设一个“售后诊断与备件协同助手”,帮助一线服务人员快速定位故障、查找适用手册、核对设备配置、查询备件库存并生成处理建议。

这个场景看似是知识问答,实际上横跨结构化与非结构化数据:设备序列号与配置来自 ERP/MES,故障代码来自设备平台,维修步骤来自手册,历史解决方案来自工单,库存来自供应链系统,保修政策来自制度文档。回答还受到权限、版本、区域政策和客户合同约束。如果 Agent 进一步发起备件预留或创建工单,就进入了受控行动。

案例会逐步暴露问题,而不是一开始给出完美架构。读者可以在每个阶段暂停,先独立作出选择,再与书中方案比较。重要的不是答案相同,而是能否说明驱动因素和后果。企业规模、系统数量和指标均为教学设定,不代表特定真实企业;读者应把它替换为自己的业务背景。

如何理解书中的图和矩阵

参考架构图表达职责与数据流,不等于部署拓扑。一个逻辑组件可以由多个产品实现,也可以在早期由同一套系统承担多个职责。图中的箭头需要说明传递的是数据、元数据、控制信号还是反馈,不能把所有连接都理解为实时接口。

选择矩阵不是自动决策器。给方案打分的价值在于暴露团队的假设和优先级,而不是计算出一个看似客观的总分。对高风险因素,应设置门槛而不是被其他高分抵消。例如某方案无法满足数据主权要求,即使成本和性能得分很高,也不应进入候选。

成熟度模型也不是竞赛。不同数据域可以处于不同等级,关键场景需要优先达到目标状态,低价值域可以保持简化。盲目追求全企业同一成熟度,会把资源投入到暂时没有消费者的能力上。

如何使用来源与引用

本书的参考资料分为“事实来源”和“设计参照”。华为白皮书用于理解 AI-Ready 数据基础设施的叙事和能力层次 (Huawei Technologies Co., Ltd. 2024年);OpenMetadata 用于研究开放上下文层的实体、关系、连接器、质量、血缘、数据产品、契约和 MCP 设计 (OpenMetadata Contributors, 不详)。引用项目时,需要回到具体源码或文档,而不是只引用 README 的定位语言。

外部来源会登记在 references/source-register.md。正式写作时,任何市场规模、企业比例、性能数字和法规要求都应补充精确出处。第一版更重视结构与方法,无法确认的数字不应为了增强说服力而被虚构。实践性白皮书的可信度,首先来自承认自己不知道什么。

推荐的实践节奏

如果把本书用于一个真实项目,可以按四周完成第一次闭环。

第一周选择场景,访谈用户,画出现状流程和问题树,建立业务基线。第二周盘点数据与上下文,完成 AI Ready 评估,明确关键缺口和最小治理范围。第三周编写数据产品 PRD、目标架构与 ADR,建立最小评估集。第四周做小范围原型,记录回答、来源、延迟、人工修正和任务结果,然后决定进入九十天实施还是停止。

如果把本书用于个人能力建设,可以用八到十二周完成作品集。每周阅读两到三章,并同步完善同一个案例。不要等读完全书才开始产出,因为早期产物会在后续章节中被不断修正。修正本身就是能力证据:它说明你能够根据新的风险和约束更新判断。

第一版、第二版与持续演进

本书的第一版目标是建立完整骨架和可讨论的初始论点。第二版需要增加更多外部证据、源码定位、真实匿名化案例和反方观点;第三版则应通过读者和项目反馈修正方法,补充失败案例与行业差异。版本之间不只修改文字,还应记录哪些架构判断发生变化、为什么变化。

AI 技术会快速迭代,但本书希望保持两类相对稳定的内容:从业务结果反向设计的思路,以及对证据、边界、责任和反馈的要求。具体模型、组件和协议可能变化,企业仍然需要回答谁消费数据、如何理解、能否信任、怎样授权、如何度量和由谁负责。

带着这些问题进入正文,读者得到的就不只是一本关于 AI Ready 的书,而是一套可以反复使用的工作方法。