24  从一个场景开始

本章产出: 一份可以从明天开始执行的行动清单,也是全书方法的最后收束。

读到这里,AI Ready Data 可能显得庞大:业务场景、数据产品、采集处理、上下文层、检索、工具、质量、契约、安全、评估和组织机制,每一项都可以展开为独立工程。如果因此得出“必须先建设完整平台”的结论,就偏离了本书的起点。

企业不需要一次让所有数据为所有 AI 就绪。它需要选择一个值得解决的任务,找出完成任务不可缺少的上下文,在风险可控的范围内走通一次闭环。第一条闭环会暴露真实的数据缺口、组织责任和技术边界;第二个场景到来时,企业才知道什么值得复用,什么只是首期偶然。

AI Ready 是一种从结果倒推的演进路线,不是一场平台重建运动。

24.1 第一天:写下一个任务

不要从“建设企业知识库”开始。找一位真实用户,观察他完成一项频繁、费时或容易出错的工作。用一句话写:

当谁处于什么情境时,需要在多长时间内作出什么判断或行动;成功如何观察,错误会造成什么后果。

然后写出不做什么。高风险动作是否保留人工,哪些用户和数据暂不覆盖,哪些结果只能建议。边界越具体,第一轮学习越快。

如果无法找到真实用户、频率、基线或结果,场景可能不适合作为首期。流行不等于价值,管理层的兴趣也不能替代用户任务。

24.2 第一周:建立场景证据

完成四项工作。

24.2.1 观察当前流程

不要只开需求会,跟随用户完成几次任务。记录他打开哪些系统、复制什么、在哪里等待、问了谁、如何判断、最后把结果写到哪里。特别观察例外和人工经验。

24.2.2 建立基线

选择一两个流程指标、一个结果指标和风险护栏。记录口径、样本和观察窗口。没有基线,上线后无法证明改变。

24.2.3 画数据需求卡

按事实、规则、经验、状态和身份列上下文,标注必须与可选、来源、时效、质量、权限和缺失行为。将输出也写成契约,包括证据、限制、澄清、拒答和升级。

24.2.4 识别最大未知

是用户不会采用,设备无法识别,文档版本混乱,模型任务能力不足,还是权限无法贯穿?第一轮技术探针只验证这个最大未知,避免一开始铺开。

第一周的成果是一份问题章程、一条基线和一张数据需求卡,而不是一套平台。

24.3 第一个月:定义 MVDP

把任务需要的上下文收敛为最小可行数据产品:

  • 明确消费者和价值;
  • 列出输入、权威来源和范围;
  • 定义实体、语义、有效时间和冲突;
  • 选择输出 API、检索或工具;
  • 给出 SLO、权限、所有者和支持;
  • 设计反馈、评估与退役。

首期宁可限定一个区域、产品系列或用户群,也不要模糊地承诺全企业。最小不是做一个无人负责的脚本,而是在较小范围达到生产最基本的可信、安全和运营门槛。

同时写目标架构,但只实现首期必要路径。明确权威事实与派生索引,批、流和请求时查询的边界,上下文和权限如何进入 Agent,读与写如何分离,失败如何降级。

24.4 建立一条可信链

第一条闭环至少做到:

  1. 源数据有所有者和可重放入口;
  2. 关键实体、语义和有效时间明确;
  3. 文档、块和索引能回到源版本;
  4. Agent 通过数据产品端口访问,不直连生产库;
  5. 身份和权限在检索前与工具执行时生效;
  6. 关键结论带证据,证据不足能够拒答;
  7. 写操作结构化、可预览、幂等并经审批;
  8. 人工修订与业务结果可关联回流;
  9. 每层都有指标、负责人和降级;
  10. 变更后能用评测集回归。

这十项不是要求首期拥有复杂平台,而是要求责任不缺席。许多能力可以手工或借助现有系统开始,再根据复用和规模产品化。

24.5 从建议模式上线

首个 Agent 不需要立即自主行动。建议模式可以让系统在真实流程中暴露错误,同时保留人的判断。关键是记录人工如何修改、为什么拒绝、最终发生什么,而不是让“人工在环”成为没有数据的口号。

建议模式也有安全要求。错误维修步骤可能影响人,敏感答案可能泄漏,系统仍需权限、引用、风险提示和停止能力。人工确认不能替代所有前置控制。

上线按离线、影子、专家、小流量和扩量推进。每一步有门禁和回滚,严重风险不被平均准确率掩盖。

24.6 每次失败都要回答“哪一层”

当用户说答案不好时,不要立刻换模型。依次检查:

  • 源事实是否存在和正确;
  • 实体与语义是否匹配;
  • 数据是否及时,规则是否有效;
  • 文档解析和分块是否完整;
  • 检索过滤、召回和排序是否正确;
  • 工具是否选择和执行正确;
  • 模型是否忠于证据和输出契约;
  • 界面与流程是否使用户能够采取行动;
  • 业务假设本身是否成立。

失败分类连接责任人和回归样本。企业由此积累的不是“模型调参经验”,而是端到端改进能力。

24.7 何时复用,何时平台化

首个场景完成后,先不要急着宣布平台。等待第二、第三个场景,用真实重叠识别共享能力:

  • 核心实体和跨域标识;
  • 术语、指标与上下文模型;
  • 身份传递、策略和审计;
  • 文档处理、混合检索和引用;
  • 工具契约、审批和幂等;
  • 评测、反馈和可观测;
  • 数据产品目录、契约、质量与血缘。

共享能力同样要有产品负责人和消费者。不要把第一个项目的内部表包装成公共平台,也不要让每个团队复制自己的向量库和权限。

平台化的触发证据是重复成本、语义冲突、交付周期和多个真实消费者,不是组织对“大平台”的想象。

24.8 面向不同岗位的行动

24.8.1 如果你是 AI 数据产品经理

选择一个场景,完成用户任务、场景矩阵、Agent 数据需求卡、MVDP 画布、指标树、PRD 和九十天路线。面试或汇报时,说明如何从业务价值倒推数据,如何定义不做范围,如何用反馈决定投资。

不要只展示原型。展示基线、权衡、失败分类、风险门禁和产品运营,体现你能跨业务、数据、模型与治理。

24.8.2 如果你是 AI 数据架构师

为同一场景画现状、目标、数据流、信任边界与失败路径;提交 RAG/语义/图、批流时效、Build/Buy/Open Source 等 ADR;定义契约、SLO、身份、血缘、评估和恢复。

不要堆产品名。解释每个组件承担什么、为何现在选择、代价是什么、何时复审。架构能力体现在判断和责任边界。

24.8.3 如果你面向首席或企业数据架构

把单场景提升为能力地图与产品组合:哪些实体和上下文跨域复用,集中治理和领域自治如何分工,平台投资如何与价值相连,供应商与退出如何管理,组织怎样运营和培养人才。

你的输出不是更大的一张技术图,而是原则、标准、例外、投资、风险和演进机制。

24.9 将本书变成个人作品集

读者可以围绕一个匿名或虚构案例整理以下作品:

  1. 两页场景与基线;
  2. AI Ready 评估表;
  3. Agent 数据需求卡;
  4. 数据产品 PRD;
  5. 现状与目标架构图;
  6. 三至五份 ADR;
  7. 权限与审计矩阵;
  8. 评测与反馈方案;
  9. 九十天路线与复盘;
  10. 组织运行章程。

作品集要保持一个案例贯穿,数字注明真实、脱敏或假设,选择注明约束。面试表达采用“背景—约束—选项—决定—后果—结果—复盘”,而不是背诵概念。即使未在真实企业完整实施,也可以清晰区分经验事实、源码研究、行业参考和自己的架构建议。

24.10 面对“消灭幻觉”

本书序言谈到幻觉,因为它是企业让模型接触真实流程时无法回避的问题。走到最后,我们应给出更精确的答案:企业不能承诺绝对消灭生成模型的幻觉,但可以把它从不可知风险变成可治理风险。

具体方式包括:

  • 用权威事实和有效规则减少自由发挥;
  • 用语义、实体和时间防止错配;
  • 用混合检索与结构化工具取得合适证据;
  • 用引用与输出契约约束结论;
  • 用权限和策略限制可见与可做;
  • 用澄清、拒答、审批和人工接管控制失败;
  • 用血缘、审计和版本实现重放;
  • 用评测、反馈和业务结果持续发现错误。

目标不是让模型“永远不会错”,而是让系统知道哪些问题可以答、答案依据什么、何时应该停、错误发生后如何定位和纠正。企业信任来自这种可控性。

24.11 一份明天的清单

如果明天只能做十件事:

  • 找一位真实用户,观察一次真实任务;
  • 写下一句话任务和三条不做;
  • 记录当前时间、结果与风险基线;
  • 列出五类上下文和权威来源;
  • 找出最可能使项目失败的数据缺口;
  • 定义一个 MVDP 与负责人;
  • 准备二十个真实和边界样本;
  • 画出身份、数据、工具与反馈链;
  • 决定证据不足时怎样拒答和接管;
  • 约定三十天后用什么证据继续或停止。

这些行动不需要等待平台预算,也不会把组织锁定在某个模型。它们会迫使团队面对真实问题,并产生下一步最重要的信息。

24.12 结语:让数据赶上智能

工业时代的机器需要稳定的电力、标准的零件和可重复的流程;AI 时代的 Agent 需要及时的事实、共同的语义、可信的证据和受控的行动。数据不是堆在仓库里的燃料,只有进入任务、产生结果、返回反馈,它才真正流动。

企业的数据不会在某一天全部“准备完成”。业务会继续变化,新的 Agent 会提出新的上下文要求,今天的契约和架构也会被明天复审。AI Ready 因此更像一种保持准备的能力:知道什么值得连接,什么必须治理,什么可以复用,什么应当拒绝。

从一个场景开始。让一个真实用户少等待一次,让一项判断多一份证据,让一次错误能够回到源头,让一个结果成为下一次改进。第一条闭环也许很小,但当这种闭环能够被反复复制,企业数据便不再只是历史记录,而成为组织感知现实、采取行动和学习未来的基础。