技术部分是成熟的,真正决定这个项目该不该做、能不能做下去的,是另外两件事。
本文对应公开社区的高频提问:律所的知识管理怎么做?有没有好用的类案检索?合同范本库怎么管理?
不同客户的卷宗、尽调材料必须严格隔离,这是执业义务,不是「最好有」。技术上要做的是:每份材料入库时打上客户归属和密级标记,用户提问时先按身份过滤候选集,再做匹配。
关键在顺序。很多系统的做法是「先捞出来,再根据角色遮挡展示」——在 RAG 架构下这是危险的:文本一旦进入模型上下文,不显示给用户,不等于信息没被处理。过滤必须发生在检索阶段。
如果某个所的保密要求高到不允许任何形式的结构化处理,我们的建议是直接不做,而不是先接单再想办法。这个边界在沟通阶段就该说清楚。
有人问「违约责任通常怎么写」,他要的是某一个条款,不是一整份合同。如果切片按固定长度切,很可能把条款的前提条件和结果切成两半,检索到后半截,给出断章取义但语气自信的答案。
按条款和章节边界切,并把章节上下文带进每个片段。这样检索到的片段本身是完整的,不会因为缺了前提条件而误导。
问一个法条编号、案号或者特定术语,纯向量检索会返回「语义相近但不是那份」的内容。法律文本对精确性要求极高,这种「差不多」的结果是不能接受的,而且是危险的——它看起来很像对的。
关键词检索 + 语义检索并行,再做一轮重排。这在法律场景里不是优化项,是必需项。只做向量检索的方案,在法条编号和案号上一定会翻车。
不做 OCR 和版面还原,多栏排版会被读成乱序文本,检索结果毫无意义。很多所的历史材料以纸质为主,这时候第一步是电子化,不是上 AI——顺序错了钱就白花了。
如果某个判断标准只存在于合伙人的脑子里、从未落纸,系统检索不到,也不会告诉你缺失,它会用检索到的内容构造一个看起来合理的答案。这是所有知识系统里最需要提前防范的一条。
上线时必须同时拿到一份「知识缺口清单」。
敢于标明缺口的系统,比一个什么都能答、实际会编的系统可靠得多。拿不出缺口清单的供应商,基本可以判断没做过真实交付。
不同所的保密要求差别极大。我们会先判断你的材料是否允许结构化处理,不适合的场景直接说明,不接单再想办法。