演示通常用几十份干净文档和精心设计的问题,跟生产环境完全是两回事。下面这三样,缺一样就别签。
本文对应公开社区的高频提问:企业 AI 知识库怎么选?怎么判断供应商靠不靠谱?自己搭还是买?
如果你用现有工具整理好的内容都没人查,换一套更贵的系统只会让问题更贵。
知识系统失败,绝大多数不是工具问题。原因通常就三个:资料按文件夹组织而人按任务检索,导致「知道有但找不到」;内容没人维护,员工照着旧版做过一次错事之后就再也不信了;系统入口不在干活的地方,员工想不起来去查。
这三件事不解决,买什么都不管用。
三十个真实问题,每个标注「应该命中哪几份文档」,跑出召回率。不要只看演示效果——演示通常用几十份干净文档和精心设计的问题,跟生产环境完全是两回事。
行业公开分析里有这样的案例:系统从测试切到生产,语料量放大后召回率明显下滑,但因为响应速度正常、团队只监控延迟,直到用户投诉才发现。这个评测集成本很低,但能救命。
每一条回答必须能定位到「来自哪份文档的哪一段」。没有这个,出了问题你连查都没法查,只能笼统地说「AI 不准」,然后整系统的可信度一起崩掉。
明确列出系统覆盖不了的部分——通常是那些只存在于资深员工脑子里、从未落纸的知识。这一条特别重要,因为 AI 不会说「我不知道」,它会用检索到的东西构造一个看起来合理的答案。
敢于给你缺口清单的供应商,比拍胸脯说什么都能答的可靠得多。
| 检查项 | 通过标准 |
|---|---|
| 评测集来源 | 用你们自己的真实问题,不是供应商准备的 |
| 召回率 | 有具体数字,且在生产语料量级下测,不是几十份文档下的数字 |
| 答案溯源 | 每条回答可定位到文档 + 段落,缺一不可 |
| 知识缺口清单 | 明确列出覆盖不了的部分,而不是「都能答」 |
| 权限过滤顺序 | 检索前过滤,不是生成后遮挡 |
| 时效字段 | 生效/失效日期可用,旧版有归档机制 |
| 长期监测 | 评测集可每月复跑,效果下滑能被发现 |
飞书、企微、Notion,先把内容按业务场景整理好放进去,跑三个月看有没有人用。等确实被用起来了、搜索确实不够用了,再考虑语义检索和 AI 问答。
那时候你至少知道自己要什么,不会被演示牵着走。这一步我们也会在沟通里先问——如果你的场景还没到这一步,我们会直说。
上面三条(评测集、溯源、缺口清单)是通用底线。落到具体行业,还有各自的硬指标:
包含评测集怎么搭、召回率怎么跑、溯源怎么查。你拿去对现有供应商也适用,不绑定我们。