企业知识智能律所行业
FOR 律师事务所 · 企业法务

合伙人脑子里那套判断标准,
能不能不靠口传

律所最难沉淀的从来不是文件数量,而是"这个条款我们一般怎么写""这类案子上次怎么处理的"。 我们做的是把卷宗、范本和内部备忘变成可以用自然语言提问的系统,同时守住保密这条底线。

律所最消耗人力的四类查找

以下来自行业公开讨论与客户访谈中的高频反馈。

合同范本找不到可用的那一版

范本库里有十几个版本的保密协议,没人说得清哪份是合伙人认可的现行版。新人只能翻最近的,或者去问。

类案与历史处理经验在个人手里

类似案件的策略、对方律师的特点、法院的倾向,大多记在经办人脑子里。人一走,经验就带走。

法规与司法解释更新跟不上

新司法解释出台后,旧的分析备忘录还留在库里,语义上和提问很匹配,检索就会把它捞出来。

客户隔离是硬要求

不同客户的卷宗、尽调材料必须严格隔离。这不是"最好有",是执业义务。通用工具在这一关基本过不了审。

我们具体怎么做

针对法律材料的三个特点:条款级复用、时效性强、保密要求最高。

一、客户隔离做在检索之前

每份卷宗在入库时打上客户归属与密级标记。用户提问时先按身份过滤候选集,再做匹配。 关键点:过滤必须发生在检索阶段,而不是"先捞出来再遮挡展示"——文本一旦进入模型上下文,遮挡就已经没有意义了。

二、条款级切分,而不是整篇切分

问"违约责任通常怎么写",需要命中的是某一个条款,而不是一整份合同。 我们按条款与章节边界切片,并保留章节上下文,避免检索到"适用但缺前提条件"的半截条款。

三、混合检索,让编号和术语能精确命中

纯语义检索在遇到法条编号、案号、专业术语时容易返回"语义相近但不是那份"的结果。 我们把关键词检索与语义检索结合,再做一轮重排。这在法律文本里不是优化项,是必需项。

四、扫描卷宗与表格材料的处理

历年卷宗大量是扫描件。不做 OCR 与版面还原,多栏排版会被读成乱序文本,检索结果毫无意义。 我们在入库前统一做版面分析,并把表格转为结构化内容。

关于保密,我们的态度:如果客户材料的保密要求高到不允许任何形式的结构化处理,我们会直接建议不做, 而不是先接单再想办法。这一条在需求沟通阶段就会讲清楚。

诚实说明:系统不会说"我不知道"。如果某个判断标准从未被写下来,它会用检索到的内容构造一个看起来合理的答案。 因此我们会同时交付知识缺口清单,标明系统确实覆盖不了的部分,供所里决定要不要补录。

适合什么样的机构

不太适合的情况:卷宗以纸质为主且未电子化、或保密要求不允许任何结构化处理。这类情况我们会在沟通阶段如实告知。

验收时请坚持三样东西:一份用你们真实问题搭的评测集与召回率数据、每条回答可定位到文档段落的答案溯源、以及一份知识缺口清单。 拿不出这三样的供应商,基本可以判断没做过真实交付。完整标准见《怎么验收才不被演示骗》; 权限这一关的具体原理见《权限与泄密风险》。

需要先确认的是保密边界

律所项目的第一步不是演示系统,是确认哪些材料可以做、哪些绝对不能碰。这个边界定下来,后面的方案才有意义。

目前处于首批试点阶段,报价按资料量与场景复杂度沟通确认,本页面不列未经确认的数字。

查看常见问题与落地方式

深入阅读