你的知识库准备好迎接 AI 了吗?12 条自检清单
在部署 RAG 或 AI Agent 之前,先检查你的知识是否准确、现行、有权属、可结构化、有权限、可追溯。用这份 12 条清单打分,并知道先修哪一项。
在建 AI 这一层之前,先给你的知识打分。
多数失败的 AI 项目不是败在模型。它们败在底下的知识不准确、过期、没人负责、没结构、权限不明、无法追溯——而 AI 这一层忠实地把这一切放大了。就绪评估已经自成一类产品(PwC 提供带评分和路线图的企业 AI 就绪评估),但其中的诊断价值,你花一个诚实的小时自己就能拿到大半。
下面是横跨六个维度的 12 条清单。这是 KifferLiu 的实用评估框架,不是行业认证——它的价值取决于你打分时有多不手下留情。
为什么 AI 就绪从知识开始
AI 系统不创造知识。它检索、重组、转述已有的东西。这个性质是对称的:
受治理的知识 → AI 听起来像你们最资深的工程师
未治理的知识 → AI 听起来像你们最生疏的实习生,
且语气毫不迟疑
系统继承知识的现状。所以下面每个维度都在选模型之前打分——向量库选型、agent 框架,这些决定在底座诚实之后都会变得更简单、更便宜、更有效。
12 条 AI 知识准备度清单
每条打分:0(否)、1(部分)、2(是,可验证)。满分 24。
1. 准确
- 我们敢为知识库里的核心事实(规格、价格、政策)背书
- 文档之间已知的冲突被识别并解决,而不是并存
2. 现行
- 对任何一份文档或事实,我们说得出哪一版是现行的
- 存在有效的机制——一个 owner 或一套流程——在现实变化时更新知识
3. 权属
- 每个知识域(产品、价格、客服、政策)有具名的 owner
- 出现错误时,公司里任何人都知道找谁修
4. 结构
- 单条事实、单个产品、单条政策可被检索——而不只是整份文档
- 跨部门术语一致(销售、工程、ERP 不给同一个产品用三个名字)
5. 权限
- 按文档或数据集,我们判得定谁可以看
- 成本数据、个人数据与公开规格是分开的,不是混在一个库里
6. 出处
- 答案能追溯到一份带日期的来源文档
- 客户或审计方可以拿着来源核验某个论断
计分
0–8 尚未就绪 先修底座,再谈部署
9–16 部分就绪 只能在受治理的切片上部署
17–20 底座良好 可以建,治理作为持续工作
21–24 AI-ready AI 这一层反而成了容易的部分
实践中有两个维度权重更高:现行和权限。过期知识无声地腐蚀下游每一个答案;权限缺失则是唯一能把内部工具变成安全事故的问题。
怎么做这次评估
分数只和产生它的那场会议一样好:
- 对的人在房间里: 懂知识的人(往往不是 IT)、懂系统的人、加一个唱反调的。唱反调者的职责是在每个 2 分后面问”证明一下”。
- 看证据,不看观点。 “现行”打 2 分的意思是:有人能当场演示某份规格哪一版现行。如果会议室开始辩论,那就是 1 分。
- 一次评一个域。 对”我们全部知识”打的分会把最需要的差异平均掉。先给你打算首先部署的那个域打分。
- 每季度重评。 就绪度是一个会耗尽的存量;第二次测量才看得到趋势。
诚实地跑一遍,通常一小时,产出的是一份十二周咨询才会画进 PPT 的东西:一张按优先级排好的、真实破损点清单。
坏的知识库长什么样
我们在中型制造企业里最常见的待治理状态:
- 同一份产品规格,2019 年 PDF、2022 年 Excel、官网页面各一份——三个都还有链接指向
- 索引里一半文档描述的是早已停售的产品
- 成本数据和公开规格躺在同一个文件夹
- “XR 系”、“G2 系列”和 ERP 编码是同一个产品,分属三个部门的叫法
- 没人说得出其中任何一项的 owner
如果四条以上听着耳熟,你在 0–8 档——这是有用的信息。现在知道,比在复盘报告里知道便宜得多。
AI-ready 的知识长什么样
同一家企业,治理之后:
- 每份文档只有一个现行、有 owner、有日期的版本;被替代版本归档且不被索引
- 单条事实可检索,跨部门术语已映射统一
- 访问级别附着在内容上,而不是没人看的文件夹上
- 每个回答都带可核验的来源引用
- 一个具名的人按固定节奏复核 AI 依赖的知识切片
这些没有一件需要新技术。需要的是决策——和一个为之负责的人。
为什么 RAG 修不好坏知识
一句话,值得钉在墙上:
RAG 能更快地检索到坏信息。它不能把坏信息变成真的。
检索放大”最容易被检索到的东西”。如果 2019 年的 PDF 措辞比 2024 年的勘误更顺口,猜猜系统端出来的是哪份。上面坏知识清单里的每一种失败模式,在 RAG 部署之后都原样活着——只是以机器速度、带着流利的自信抵达客户。
所以治理先于架构:这些学科与知识治理高度重叠,而整个栈——检索、权限、记忆、工具——的决定都发生在上游的上下文工程里。
先修哪一项
分数低,不要四面出击。按回报排序:
- 选一条流程(客服、报价、规格查询)——永远不要一次治理”全部知识”
- 对这一块去重、版本化;死掉的归档
- 指定一个 owner——这一个决定的寿命比任何工具都长
- 先把不能漏的分出去(成本、个人信息),再谈索引
- 从第一天就带引用,让每个回答持续自证
然后,也只有在那时,才选检索架构——包括你到底需不需要 agentic RAG。
在建 AI 这一层之前,先给知识打分。
一小片受治理的知识,每一次都赢过一大堆有雄心的文档。我们把这项评估做进每次部署:见我们如何构建企业 AI 系统。
常见问题
什么样的知识库算 AI-ready?
六个属性:信息准确、能说清哪一版现行、每个域有 owner、单条事实可被检索(而不只是整份文档)、按用户可判定访问权限、答案能追溯回证据。同时缺好几项,是 RAG 项目失败最常见的原因。
怎么为 RAG 准备文档?
版本去重、标出哪份现行、把内容拆到单条事实可检索、记录权属和更新日期、把访问级别不同的信息分开、保留来源引用以便答案可以引用证据。
RAG 一定要结构化数据吗?
RAG 本身跑非结构化文本,但知识有内部结构时效果好得多:术语一致、文档有版本、访问级别分离、事实可定位。不需要完整的数据库结构;需要的是内部一致性。
怎么评估 AI 知识准备度?
按准确、新鲜、权属、结构、权限、出处六个维度,对照明确的检查项如实打分,然后先修最低分。本页的框架是一份务实的自评工具;PwC 等机构的企业级 AI 就绪评估走的是同样的打分-诊断-路线图路径,只是规模完整。
PDF 可以当 AI 知识库吗?
技术上可以,多数制造企业也从这里起步。但 PDF 有风险:多版本流传、表格提取糟糕、权限几乎不随文件走。去重、版本化、有 owner 的 PDF 是可用来源;一个无人治理的文件夹不是。
关于作者
Kiffer Liu
Kiffer Liu 以 fractional Forward Deployed Engineer 的方式工作:嵌入业务,端到端地构建并上线企业 AI 系统——知识治理、检索、Agent,以及直面真实 ERP 与文档环境的部署。
更多关于 Kiffer Liu →