企业知识智能律所 · 知识管理
律所行业

律所上知识系统,
最难的不是技术,是保密边界和颗粒度

技术部分是成熟的,真正决定这个项目该不该做、能不能做下去的,是另外两件事。

企业知识智能/常见问题/律所知识管理

本文对应公开社区的高频提问:律所的知识管理怎么做?有没有好用的类案检索?合同范本库怎么管理?

一、保密:这一条决定能不能做

不同客户的卷宗、尽调材料必须严格隔离,这是执业义务,不是「最好有」。技术上要做的是:每份材料入库时打上客户归属和密级标记,用户提问时先按身份过滤候选集,再做匹配。

关键在顺序。很多系统的做法是「先捞出来,再根据角色遮挡展示」——在 RAG 架构下这是危险的:文本一旦进入模型上下文,不显示给用户,不等于信息没被处理。过滤必须发生在检索阶段。

如果某个所的保密要求高到不允许任何形式的结构化处理,我们的建议是直接不做,而不是先接单再想办法。这个边界在沟通阶段就该说清楚。

二、颗粒度:律所的检索单位是「条款」,不是「整篇」

有人问「违约责任通常怎么写」,他要的是某一个条款,不是一整份合同。如果切片按固定长度切,很可能把条款的前提条件和结果切成两半,检索到后半截,给出断章取义但语气自信的答案。

做法

按条款和章节边界切,并把章节上下文带进每个片段。这样检索到的片段本身是完整的,不会因为缺了前提条件而误导。

三、纯语义检索在法律文本里不够用

问一个法条编号、案号或者特定术语,纯向量检索会返回「语义相近但不是那份」的内容。法律文本对精确性要求极高,这种「差不多」的结果是不能接受的,而且是危险的——它看起来很像对的。

做法

关键词检索 + 语义检索并行,再做一轮重排。这在法律场景里不是优化项,是必需项。只做向量检索的方案,在法条编号和案号上一定会翻车。

四、历史卷宗大量是扫描件

不做 OCR 和版面还原,多栏排版会被读成乱序文本,检索结果毫无意义。很多所的历史材料以纸质为主,这时候第一步是电子化,不是上 AI——顺序错了钱就白花了。

五、AI 不会说「我不知道」

如果某个判断标准只存在于合伙人的脑子里、从未落纸,系统检索不到,也不会告诉你缺失,它会用检索到的内容构造一个看起来合理的答案。这是所有知识系统里最需要提前防范的一条。

上线时必须同时拿到一份「知识缺口清单」。
敢于标明缺口的系统,比一个什么都能答、实际会编的系统可靠得多。拿不出缺口清单的供应商,基本可以判断没做过真实交付。

这几种情况,我们建议直接不做

  • 保密要求不允许任何形式的结构化处理
  • 材料以纸质为主、完全没有电子化(先做电子化)
  • 有效文档不足百份,或问题本来就不重复(收益覆盖不了成本)

我们能交付到哪一步

  • 保密边界前置评估,明确哪些材料可入库、哪些必须排除
  • 条款级切片 + 章节上下文保留
  • 关键词与语义混合检索 + 重排
  • 扫描件 OCR 与版面还原、表格结构化
  • 答案溯源(能定位到哪份材料哪一段)+ 知识缺口清单
  • 私有化部署,卷宗不出你的环境

先做一次保密边界评估

不同所的保密要求差别极大。我们会先判断你的材料是否允许结构化处理,不适合的场景直接说明,不接单再想办法。

提交后进入需求沟通,我们不会群发营销信息。若你的场景被判定为不适合做,会直接说明。

目前处于首批试点阶段,报价按资料量与场景复杂度沟通确认,本页面不列未经确认的数字。

已收到 ✓ 我们会在两个工作日内回复,先就你写下的那类查询给出「能做到 / 做不到」的边界判断,再谈方案。

相关页面