企业知识智能常见问题
FAQ

上 AI 知识库之前,
先把这八个问题想清楚

这些问题来自行业公开讨论和我们与客户沟通中的高频提问。答案不讨巧,但都是真话—— 如果你的场景被我们判定为不适合做,我们也会直说。

1. 为什么花了几万块建的知识库,根本没人用?

最常见的原因不是工具不行,是三条:资料按文件夹组织而人按任务检索,导致"知道有但找不到"; 内容没人维护,员工照着旧版做过一次错事之后就再也不信了;系统入口不在干活的地方,员工想不起来去查。 解法是反过来做——先挑一个高频场景做透,按问题组织内容,把入口嵌进工作流,再指定一个兼职的人负责更新。 全量导入基本等于把混乱搬了个家。

2. AI 回答得很流畅,但答案经常是错的,问题出在哪?

大部分"模型答错了"其实是检索错了,模型只是忠实复述它拿到的内容。常见原因有五个: 新旧版本文档同时在库而检索没有时间概念;固定长度切片把关键清单从中间切断; 纯语义检索遇到编号和专业术语会返回"相近但不是"的结果;扫描件没做 OCR 和版面还原; 上线后召回率悄悄下降但没人监测。前四条属于数据工程问题,第五条属于运维缺失。

3. 最大的风险是什么?

不是答错,是泄密。如果权限设计缺失,普通员工提问可能把只有主管能看的薪酬结构、或另一个客户的卷宗检索出来, 而系统还会把它组织得清清楚楚。关键在于:过滤必须发生在检索阶段,不能等到答案生成后再遮挡展示—— 文本一旦进入模型上下文,遮挡显示就已经没有意义了。

4. 政策或法规更新后,怎么保证不引用旧版?

给每份文档登记生效日期与失效日期,新版入库时把旧版从检索索引里归档,而不是并排留着。 通用的语义检索只看相似度、不看时间,这一点在现实里踩坑极多——尤其财税和法律的时效性都很强。 财税方案与 律所方案都把这一步作为基础项。

5. 我们有很多扫描件和表格,能用吗?

能用,但必须先处理。扫描件不过 OCR 与版面还原,多栏排版会被读成乱序;表格如果切片时表头和数据行被拆散, 问"某项在第二季度是多少"就永远拼不出答案。我们在入库前统一做版面分析和表格结构化。 如果材料以纸质为主且完全没有电子化,那第一步是电子化,不是上 AI。

6. 上线之后怎么判断效果有没有变差?

建一个小评测集:三十个真实问题,每个标注"应该命中哪几份文档",每月跑一次看召回率。 行业公开分析里有这样的案例——系统从测试环境切到生产环境后召回率明显下滑,但因为响应速度正常、团队只监控延迟, 直到用户投诉才被发现。这个评测集成本很低,但能救命。

7. 有哪些知识是系统永远检索不到的?

所有只存在于人脑里、从未被写成文字的知识。而且要注意:AI 不会说"我不知道", 它会用检索到的内容构造一个看起来合理的答案。所以我们会同时交付一份知识缺口清单, 明确列出系统覆盖不了的部分。敢于标明缺口的系统,比一个什么都能答、实际会编的系统可靠得多。

8. 自己搭还是买?怎么验收才不被忽悠?

先问自己一句:如果用现有工具整理好的内容都没人查,换一套更贵的系统只会让问题更贵。 验收时坚持三件事:要一份真实问题的评测集及召回率数据(而不是只看演示效果); 要答案溯源(能定位到哪份文档哪一段);要知识缺口清单(明确知道系统做不到什么)。 拿不出这三样的,基本可以判断没做过真实交付。

还有具体问题?

从一次需求沟通开始。说清你最想解决的是哪一类查询,我们会基于你的资料现状给出能做到与做不到的边界。

目前处于首批试点阶段,报价按资料量与场景复杂度沟通确认,本页面不列未经确认的数字。

了解整体方案

深入阅读