作者 Kiffer Liu 发布于 2026年8月19日

你的知识库准备好迎接 AI 了吗?12 条自检清单

在部署 RAG 或 AI Agent 之前,先检查你的知识是否准确、现行、有权属、可结构化、有权限、可追溯。用这份 12 条清单打分,并知道先修哪一项。

在建 AI 这一层之前,先给你的知识打分。

多数失败的 AI 项目不是败在模型。它们败在底下的知识不准确、过期、没人负责、没结构、权限不明、无法追溯——而 AI 这一层忠实地把这一切放大了。就绪评估已经自成一类产品(PwC 提供带评分和路线图的企业 AI 就绪评估),但其中的诊断价值,你花一个诚实的小时自己就能拿到大半。

下面是横跨六个维度的 12 条清单。这是 KifferLiu 的实用评估框架,不是行业认证——它的价值取决于你打分时有多不手下留情。

为什么 AI 就绪从知识开始

AI 系统不创造知识。它检索、重组、转述已有的东西。这个性质是对称的:

受治理的知识  →  AI 听起来像你们最资深的工程师
未治理的知识  →  AI 听起来像你们最生疏的实习生,
                 且语气毫不迟疑

系统继承知识的现状。所以下面每个维度都在选模型之前打分——向量库选型、agent 框架,这些决定在底座诚实之后都会变得更简单、更便宜、更有效。

12 条 AI 知识准备度清单

每条打分:0(否)、1(部分)、2(是,可验证)。满分 24。

1. 准确

  • 我们敢为知识库里的核心事实(规格、价格、政策)背书
  • 文档之间已知的冲突被识别并解决,而不是并存

2. 现行

  • 对任何一份文档或事实,我们说得出哪一版是现行的
  • 存在有效的机制——一个 owner 或一套流程——在现实变化时更新知识

3. 权属

  • 每个知识域(产品、价格、客服、政策)有具名的 owner
  • 出现错误时,公司里任何人都知道找谁修

4. 结构

  • 单条事实、单个产品、单条政策可被检索——而不只是整份文档
  • 跨部门术语一致(销售、工程、ERP 不给同一个产品用三个名字)

5. 权限

  • 按文档或数据集,我们判得定谁可以看
  • 成本数据、个人数据与公开规格是分开的,不是混在一个库里

6. 出处

  • 答案能追溯到一份带日期的来源文档
  • 客户或审计方可以拿着来源核验某个论断

计分

 0–8    尚未就绪         先修底座,再谈部署
 9–16   部分就绪         只能在受治理的切片上部署
17–20   底座良好         可以建,治理作为持续工作
21–24   AI-ready         AI 这一层反而成了容易的部分

实践中有两个维度权重更高:现行权限。过期知识无声地腐蚀下游每一个答案;权限缺失则是唯一能把内部工具变成安全事故的问题。

怎么做这次评估

分数只和产生它的那场会议一样好:

  • 对的人在房间里: 懂知识的人(往往不是 IT)、懂系统的人、加一个唱反调的。唱反调者的职责是在每个 2 分后面问”证明一下”。
  • 看证据,不看观点。 “现行”打 2 分的意思是:有人能当场演示某份规格哪一版现行。如果会议室开始辩论,那就是 1 分。
  • 一次评一个域。 对”我们全部知识”打的分会把最需要的差异平均掉。先给你打算首先部署的那个域打分。
  • 每季度重评。 就绪度是一个会耗尽的存量;第二次测量才看得到趋势。

诚实地跑一遍,通常一小时,产出的是一份十二周咨询才会画进 PPT 的东西:一张按优先级排好的、真实破损点清单。

坏的知识库长什么样

我们在中型制造企业里最常见的待治理状态:

  • 同一份产品规格,2019 年 PDF、2022 年 Excel、官网页面各一份——三个都还有链接指向
  • 索引里一半文档描述的是早已停售的产品
  • 成本数据和公开规格躺在同一个文件夹
  • “XR 系”、“G2 系列”和 ERP 编码是同一个产品,分属三个部门的叫法
  • 没人说得出其中任何一项的 owner

如果四条以上听着耳熟,你在 0–8 档——这是有用的信息。现在知道,比在复盘报告里知道便宜得多。

AI-ready 的知识长什么样

同一家企业,治理之后:

  • 每份文档只有一个现行、有 owner、有日期的版本;被替代版本归档且不被索引
  • 单条事实可检索,跨部门术语已映射统一
  • 访问级别附着在内容上,而不是没人看的文件夹上
  • 每个回答都带可核验的来源引用
  • 一个具名的人按固定节奏复核 AI 依赖的知识切片

这些没有一件需要新技术。需要的是决策——和一个为之负责的人。

为什么 RAG 修不好坏知识

一句话,值得钉在墙上:

RAG 能更快地检索到坏信息。它不能把坏信息变成真的。

检索放大”最容易被检索到的东西”。如果 2019 年的 PDF 措辞比 2024 年的勘误更顺口,猜猜系统端出来的是哪份。上面坏知识清单里的每一种失败模式,在 RAG 部署之后都原样活着——只是以机器速度、带着流利的自信抵达客户。

所以治理先于架构:这些学科与知识治理高度重叠,而整个栈——检索、权限、记忆、工具——的决定都发生在上游的上下文工程里。

先修哪一项

分数低,不要四面出击。按回报排序:

  1. 选一条流程(客服、报价、规格查询)——永远不要一次治理”全部知识”
  2. 对这一块去重、版本化;死掉的归档
  3. 指定一个 owner——这一个决定的寿命比任何工具都长
  4. 先把不能漏的分出去(成本、个人信息),再谈索引
  5. 从第一天就带引用,让每个回答持续自证

然后,也只有在那时,才选检索架构——包括你到底需不需要 agentic RAG

在建 AI 这一层之前,先给知识打分。

一小片受治理的知识,每一次都赢过一大堆有雄心的文档。我们把这项评估做进每次部署:见我们如何构建企业 AI 系统。

常见问题

什么样的知识库算 AI-ready?

六个属性:信息准确、能说清哪一版现行、每个域有 owner、单条事实可被检索(而不只是整份文档)、按用户可判定访问权限、答案能追溯回证据。同时缺好几项,是 RAG 项目失败最常见的原因。

怎么为 RAG 准备文档?

版本去重、标出哪份现行、把内容拆到单条事实可检索、记录权属和更新日期、把访问级别不同的信息分开、保留来源引用以便答案可以引用证据。

RAG 一定要结构化数据吗?

RAG 本身跑非结构化文本,但知识有内部结构时效果好得多:术语一致、文档有版本、访问级别分离、事实可定位。不需要完整的数据库结构;需要的是内部一致性。

怎么评估 AI 知识准备度?

按准确、新鲜、权属、结构、权限、出处六个维度,对照明确的检查项如实打分,然后先修最低分。本页的框架是一份务实的自评工具;PwC 等机构的企业级 AI 就绪评估走的是同样的打分-诊断-路线图路径,只是规模完整。

PDF 可以当 AI 知识库吗?

技术上可以,多数制造企业也从这里起步。但 PDF 有风险:多版本流传、表格提取糟糕、权限几乎不随文件走。去重、版本化、有 owner 的 PDF 是可用来源;一个无人治理的文件夹不是。

关于作者

K

Kiffer Liu

Kiffer Liu 以 fractional Forward Deployed Engineer 的方式工作:嵌入业务,端到端地构建并上线企业 AI 系统——知识治理、检索、Agent,以及直面真实 ERP 与文档环境的部署。

更多关于 Kiffer Liu →