财税材料的难点不是"找不到",而是"找到了也不敢用"——不知道这份是不是最新版,不知道这个口径适不适用于眼前这个客户, 不知道三年前那份底稿为什么那样处理。我们做的就是把这层不确定性压下去。
以下来自行业公开讨论与客户访谈中的高频反馈,不是我们编的场景。
新旧政策文件同时在库,检索只看语义相似度、不看生效时间。一线引用了已废止条款,问题往往在客户问起时才暴露。
同一个税种的处理方式,散落在老员工的记忆、往年底稿和几份内部备忘里。新人只能逐个问,效率取决于谁在工位。
汇算清缴、年报季集中爆发,新人上手慢、老人被反复打断。重复问题消耗掉的是最贵的那部分人力。
底稿、账套、客户身份信息属于高度敏感内容。放进公有云通用工具里,多数事务所的合规审查根本过不了。
针对财税材料的三个特点:时效性强、口径多、保密要求高。
每份政策文件登记生效日期与失效日期。新版入库时旧版自动归档出检索索引,而不是并排留着让系统猜。 这是财税场景里最基础、也最容易被忽略的一步——通用的语义检索没有时间概念。
一线的问题通常是"这个客户的这种情况按哪个口径处理",而不是"帮我找某号文"。 我们把政策条文、内部备忘、历史底稿按业务场景重组成可回答的条目,每条带责任人和复核日期。
申报表、台账、计算表是财税的主力文档类型。如果切片时把表头和数据行拆散, 问"某项在第二季度是多少"就永远拼不出答案。我们对表格做结构化解析,保留表头与行的对应关系。
不同客户的底稿在元数据层就打上归属标记,检索时先按权限过滤。 这一点必须在检索阶段完成,不能等到答案生成后再遮挡——文本一旦进入模型上下文,遮挡展示已经没有意义。
诚实说明:系统能给出的答案,取决于知识是否已经被写成文字。如果某个口径只存在于某位资深同事的判断里、从未落纸, 系统检索不到,也不会说"我不知道"。我们会在交付时给出知识缺口清单,把这部分明确标出来交给你补。
不太适合的情况:资料本身极少(不足百份有效文档)、或团队规模很小、问题本来就不重复——这类场景上系统的收益有限,我们也会如实说明。
从一次需求沟通开始。说清你最想解决的是哪一类查询,我们会基于你的资料现状给出能做到的边界和做不到的部分——包括明确告诉你哪些场景不适合做。
目前处于首批试点阶段,报价按资料量与场景复杂度沟通确认,本页面不列未经确认的数字。
查看常见问题与落地方式