企业知识智能选型 · 验收标准
选型验收

怎么验收一套 AI 知识库,
才不会被演示牵着走

演示通常用几十份干净文档和精心设计的问题,跟生产环境完全是两回事。下面这三样,缺一样就别签。

本文对应公开社区的高频提问:企业 AI 知识库怎么选?怎么判断供应商靠不靠谱?自己搭还是买?

先说一句可能得罪同行的话

如果你用现有工具整理好的内容都没人查,换一套更贵的系统只会让问题更贵。

知识系统失败,绝大多数不是工具问题。原因通常就三个:资料按文件夹组织而人按任务检索,导致「知道有但找不到」;内容没人维护,员工照着旧版做过一次错事之后就再也不信了;系统入口不在干活的地方,员工想不起来去查。

这三件事不解决,买什么都不管用。

验收要三样东西

第一样:评测集和召回率数据

三十个真实问题,每个标注「应该命中哪几份文档」,跑出召回率。不要只看演示效果——演示通常用几十份干净文档和精心设计的问题,跟生产环境完全是两回事。

行业公开分析里有这样的案例:系统从测试切到生产,语料量放大后召回率明显下滑,但因为响应速度正常、团队只监控延迟,直到用户投诉才发现。这个评测集成本很低,但能救命。

第二样:答案溯源

每一条回答必须能定位到「来自哪份文档的哪一段」。没有这个,出了问题你连查都没法查,只能笼统地说「AI 不准」,然后整系统的可信度一起崩掉。

第三样:知识缺口清单

明确列出系统覆盖不了的部分——通常是那些只存在于资深员工脑子里、从未落纸的知识。这一条特别重要,因为 AI 不会说「我不知道」,它会用检索到的东西构造一个看起来合理的答案。

敢于给你缺口清单的供应商,比拍胸脯说什么都能答的可靠得多。

验收清单(可直接对照)

检查项通过标准
评测集来源用你们自己的真实问题,不是供应商准备的
召回率有具体数字,且在生产语料量级下测,不是几十份文档下的数字
答案溯源每条回答可定位到文档 + 段落,缺一不可
知识缺口清单明确列出覆盖不了的部分,而不是「都能答」
权限过滤顺序检索前过滤,不是生成后遮挡
时效字段生效/失效日期可用,旧版有归档机制
长期监测评测集可每月复跑,效果下滑能被发现

还有三种情况,建议直接不做

  • 有效文档不足百份,或者问题本来就不重复——上系统的收益覆盖不了成本。
  • 材料以纸质为主、完全没电子化——第一步是电子化,不是上 AI。
  • 保密要求不允许任何形式的结构化处理——这个边界在沟通阶段就该说清楚。

最后说选型:先用你现有的

飞书、企微、Notion,先把内容按业务场景整理好放进去,跑三个月看有没有人用。等确实被用起来了、搜索确实不够用了,再考虑语义检索和 AI 问答。

那时候你至少知道自己要什么,不会被演示牵着走。这一步我们也会在沟通里先问——如果你的场景还没到这一步,我们会直说。

不同行业的验收侧重不同

上面三条(评测集、溯源、缺口清单)是通用底线。落到具体行业,还有各自的硬指标:

我们能交付到哪一步

  • 先用现有工具的自检路径与判断标准(这一步可能不需要我们)
  • 评测集搭建与召回率基线测量
  • 答案溯源、知识缺口清单、权限模型设计
  • 私有化部署,数据不出你的环境

拿一份可自行使用的验收清单

包含评测集怎么搭、召回率怎么跑、溯源怎么查。你拿去对现有供应商也适用,不绑定我们。

提交后进入需求沟通,我们不会群发营销信息。若你的场景被判定为不适合做,会直接说明。

目前处于首批试点阶段,报价按资料量与场景复杂度沟通确认,本页面不列未经确认的数字。

已收到 ✓ 我们会在两个工作日内回复,先就你写下的那类查询给出「能做到 / 做不到」的边界判断,再谈方案。

相关页面