从企业数据到 AI Ready

数据产品与架构实践白皮书

作者

通哥

序言:缙云山上的数据回声

雾从山谷升起

写下这些文字时,我在重庆北碚的缙云山。

清晨的雾从山谷里缓慢升起,先遮住远处的屋顶,再把山腰的树木一层层收进灰白色的背景。偶尔有鸟从林间掠过,声音很近,身影却看不清。山下的城市正在醒来:道路开始拥挤,工厂的生产线重新运转,办公室里的屏幕依次亮起,消息、表格、订单、告警和会议邀请像潮水一样进入企业。再过一会儿,无数个模型和 Agent 也会被唤醒。它们会总结昨夜的销售变化,分析客户投诉,检查库存,生成代码,回答员工的问题,甚至代替人发起某些业务动作。

站在山上回望城市,很容易产生一种时间被折叠的感觉。古老的山体几乎没有变化,山下的生产方式却在短短几代人的时间里反复重写。人类曾经依靠肌肉和牲畜搬运物资,后来让蒸汽推动机器;曾经依靠师傅的经验组织生产,后来让电力、流水线和标准化把经验固化为流程;曾经依靠纸张和口耳相传传递信息,后来让计算机、数据库和互联网把信息变成可以复制、计算和远距离传输的数字。

今天,我们又站在一次变化的门槛上。

这一次,被重新分配的不只是体力,也不只是信息,而是部分理解、判断、表达和执行的能力。生成式 AI 能够阅读过去只有人能阅读的文档,能够在海量资料中寻找线索,能够编写程序、解释报表、拆解任务,并通过工具进入企业流程。当 Agent 开始连接数据库、知识库、工单系统和业务 API,它就不再只是一个会聊天的模型,而可能成为组织中的新型执行单元。

然而,雾也在这里。

模型能说出流畅的话,却不天然知道企业内部什么是真的;它能给出像答案的答案,却不天然理解某个指标由谁定义、某张表是否已经过期、某个字段能否被当前用户查看;它能调用工具,却不天然知道什么动作需要审批、失败后如何回滚、哪一条规定刚刚发生了变化。语言模型善于在可能性中生成最像答案的内容,企业经营却要求在约束中给出可验证、可负责的结果。

这正是本书开始的地方。

从机器的力量到组织的智能

回顾工业革命,我们会发现,每一次生产力跃迁都不是因为出现了一台更强的机器便自然完成。蒸汽机需要煤矿、铁路、工厂制度和新的分工;电力需要电网、标准、电机和重新设计的生产线;计算机需要软件、数据库、网络以及围绕数字系统建立起来的管理流程。真正改变社会的,从来不是孤立的发明,而是发明与基础设施、组织制度、知识体系和反馈机制相互咬合之后形成的新生产系统。

AI 革命同样如此。

大模型像一台高度通用的新机器。它降低了理解自然语言、生成内容和处理非结构化信息的门槛,却没有自动解决企业里的数据碎片、口径冲突、权限混乱和责任缺失。一个模型在公开知识上表现优秀,并不意味着它进入一家企业后就能理解“客户”“收入”“有效订单”“高价值用户”这些词在该企业中的真实含义。两个部门可能使用同一个名词,却指向不同的统计范围;同一张报表可能因为刷新时间不同,在上午九点和十点给出不同结论;一份制度文件可能仍然被搜索到,但它已经被新版本替代。

所以,AI 的落地不能只围绕模型展开。它需要企业把自己的事实、规则、语义、关系和历史经验组织成机器可以发现、理解、信任和调用的上下文。过去的数据平台主要服务分析师、工程师和业务人员;未来的数据系统还要服务不会默默容忍含糊之处的 Agent。人看到字段名不清楚,可以发消息问同事;Agent 如果没有获得足够上下文,往往会用概率填补空白。人发现数据异常,可能凭经验暂时绕开;Agent 如果缺少质量信号,可能把异常当成事实放大到下一步行动。

这意味着企业数据正在获得一个新的消费者,也获得一套更高的要求。

这里所说的 AI Ready,并不是把所有数据搬进向量数据库,也不是给数据仓库贴上新的标签。它指的是:在一个明确的业务场景里,数据及其上下文能够被人、应用和 Agent 及时找到、正确理解、可信使用、安全调用,并且每一次使用都可以被评估、审计和改进。

“Ready”不是一个永久状态。数据今天适合回答经营分析问题,并不代表它适合支持自动审批;适合训练一个内部模型,并不代表它可以暴露给外部应用;每天更新足以支持月度复盘,并不代表它能支持分钟级库存调度。AI Ready 必须和任务、风险、时间窗口以及允许的行动范围放在一起讨论。

数据为什么必须形成回声

在山里说话,有时会听见回声。声音离开人,撞到远处的山壁,再返回耳边。返回的声音虽然稍有延迟,却证明那句话抵达了某处。

企业中的数据也需要回声。

订单产生以后,库存有没有正确扣减?客户提交问题以后,服务是否真正改善?Agent 给出建议以后,业务人员是否采纳?一次自动执行失败以后,原因有没有被记录?一个指标定义调整以后,下游报表和提示词是否同步变化?如果数据只从业务系统单向流向模型,而模型的使用结果没有回到数据、产品和流程中,那么企业获得的只是一次性回答,而不是会成长的能力。

真正有价值的 AI 系统必须形成闭环:

现实发生变化,系统捕获变化;数据被加工并附加上下文;模型或 Agent 基于上下文进行判断;判断进入业务流程产生结果;结果被记录、评价并反馈到下一轮。

这个闭环里,速度很重要,但并非所有数据都要实时。更重要的是反馈能否赶上决策窗口。财务月结数据晚十分钟可能无关紧要,支付欺诈信号晚十分钟却可能意味着损失;设备预测性维护允许几分钟延迟,安全联锁则可能要求毫秒级响应。数据的及时性不是技术团队单方面追求的数值,而是业务后果、实现成本和系统可靠性共同决定的服务承诺。

闭环也不能只有速度。错误如果被快速传播,只会更快地造成损失。数据需要质量规则、血缘、版本、所有者和契约;Agent 的回答需要来源、置信边界、权限检查和审计记录;高风险动作需要审批、幂等、回滚和人工接管。反馈不是把一切都自动化,而是让系统知道自己做了什么、结果如何、哪里需要停下来请人判断。

当企业具备这样的回声,AI 才不只是一个安装在组织外部的聪明工具,而会逐渐成为组织运行机制的一部分。

关于幻觉:不是消灭概率,而是建立边界

人们常说,希望用企业数据“消灭”大模型幻觉。这个愿望可以理解,却需要更谨慎地表达。

幻觉不是简单的数据不足问题。它来自生成机制本身,也可能来自错误的检索结果、过期文档、歧义问题、冲突口径、工具调用失败和不恰当的系统设计。即使企业拥有完美的数据仓库,也不能保证模型在任何问题上永不出错。声称彻底消灭幻觉,反而可能制造新的管理幻觉:让组织误以为系统已经可靠到不需要验证和治理。

企业真正应该追求的,是把不可控的幻觉转化为可以管理的风险。

第一,让模型尽量依据经过治理的企业事实回答,而不是仅凭参数记忆猜测。第二,让检索结果携带来源、版本、所有者、质量和适用范围,使模型知道“这是什么”以及“能否相信”。第三,对结构化事实优先使用查询、语义层和确定性工具计算,不让语言模型凭文字推断本可精确得到的数字。第四,要求回答引用证据,并允许用户追溯到原始资产。第五,为模型设计拒答和升级机制:证据不足时明确说不知道,风险过高时交给人。第六,通过评估集、线上反馈和事故复盘持续发现失败模式,而不是只在演示时挑选成功案例。

因此,Data for AI Ready 的核心价值不是给模型塞入更多数据,而是提供更合适的上下文和更清晰的边界。它让模型知道什么是事实、事实从哪里来、何时更新、由谁负责、适用于什么问题、当前用户能看到什么,以及如果不确定应该怎样行动。

从这个角度看,元数据不再只是数据目录里的说明文字。质量不再只是工程团队的告警。血缘不再只是故障排查图。数据契约不再只是生产者和消费者之间的文档。它们共同构成了 AI 判断企业事实时所依赖的“认识论基础设施”:系统用什么方式知道自己知道,又用什么方式知道自己不知道。

这本书要回答什么

这不是一本只讨论趋势的书。趋势能够解释为什么现在值得行动,却无法告诉团队明天应该先做什么。它也不是一本组件手册。列出湖仓、向量数据库、知识图谱和 Agent 平台的名字,并不能自动组成一套适合企业的架构。

本书试图回答一组更接近实践的问题:

  • 如何判断一个 AI 场景是否值得优先投入?
  • 如何把 Agent 的任务翻译为数据、语义、时效、权限和评估需求?
  • 什么才是可以被持续运营的数据产品?
  • 企业应该怎样设计从数据源、处理、上下文到 Agent 服务的参考架构?
  • RAG、语义层、知识图谱和结构化查询分别解决什么问题?
  • 什么数据需要实时,什么数据不需要?
  • 如何用质量、血缘、契约、权限、审计和反馈约束 AI 风险?
  • 中小企业怎样避免大平台先行,以最小闭环验证价值?
  • 数据产品经理、数据架构师和企业数据负责人应当如何分工,又如何共同作出决策?

全书把 AI Ready Data 分为四个相互衔接的层次:基础设施 Ready、数据工程 Ready、上下文 Ready 和 Agent Ready。华为的 AI-Ready 数据基础设施参考架构为我们观察计算、存储和网络层提供了一个视角 (Huawei Technologies Co., Ltd. 2024年);OpenMetadata 的源码与模式设计,则为元数据、语义、质量、血缘、数据产品、数据契约和 MCP 如何组成开放上下文层提供了可研究的工程样本 (OpenMetadata Contributors, 不详)。本书不会把任何单一厂商或开源项目当作标准答案,而会把它们拆解成可以迁移的设计思想,再放回企业的约束中检验。

为了避免所有观点停留在抽象层面,书中还设置了一个贯穿式案例:“山城精工”。它是一家虚构化的中型制造企业,拥有 ERP、MES、CRM、供应链、设备数据和大量文档知识。它希望通过 AI 提高售后诊断与经营协同效率,却必须面对数据口径、知识更新、访问权限和执行风险。我们将从业务问题开始,为它定义数据产品、设计目标架构、记录关键 ADR,并制定九十天路线图。这个案例不是标准模板,而是用来展示高级岗位最重要的能力:在约束中作出选择,并对选择的后果负责。

写给正在建设新能力的人

我希望这本书最终既能放在企业管理者的桌上,也能放在数据团队的评审会上。管理者可以从中看见 AI 投资为什么不能只买模型和算力;产品经理可以从中找到从场景到指标的路径;架构师可以从中获得分层、接口、权衡和治理框架;工程师可以据此理解为什么一个字段描述、一次血缘采集或一条质量规则,会影响 Agent 的最终判断。

我也把它写给那些正在为下一个职业阶段积累系统能力的人。高级岗位的价值并不在于背诵更多名词,而在于能够连接业务、产品、数据、技术、风险与组织:看见局部问题背后的系统结构,把模糊愿景变成可验证方案,在多种选择之间说明取舍,并在结果不及预期时完成复盘。

写作本身就是一次这样的训练。每一个章节都要求我们追问:这个概念解决谁的问题?它依赖什么前提?如何被度量?失败会怎样?替代方案是什么?如果不能回答这些问题,再漂亮的架构图也只是一幅没有地基的图。

窗外的雾正在散去。缙云山的轮廓重新清晰,远处的城市也露出更多细节。技术时代的雾不会一次散尽,但我们可以建立看清道路的方法。

AI 会继续变强,模型会继续迭代,Agent 能够完成的任务会越来越多。企业真正需要准备的,不是追逐每一个新名词,而是建设一种持久的能力:让可信的数据及时抵达需要它的人和 Agent,让每一次判断都有依据,让每一次行动留下痕迹,让每一次结果都能返回系统,成为下一轮改进的起点。

这就是从企业数据到 AI Ready 的路。

也是这本书想与你一起走过的路。

——写于重庆北碚缙云山