一种文档类型,百万个文件:SQL表RAG查询的结构化提取

企业文档智能[第1卷第14C期]——一小时两人六到十个字段,以及区分真实列和稍后会破坏筛选器的列的两个信号。该文章《一种文档类型,百万份文件:将结构化提取到

来源:走向数据科学

现在,RAG 的许多工作都是让模型发现文档集合的结构:读取每个文件、提取实体、推断关系,然后生成一个无需任何人设计的图表。在同一份合同的五千份副本上,没有什么可发现的。

询问提交这些合同的人他们是通过什么来查找内容的。答案大约需要十秒钟:客户、生效日期、产品、保费、续保日期、保单号码。

没有人通过阅读文档找到这六个。它们是多年前由起草表格的人设计的,此后的每一份文件都是根据它们填写的。这些文件是一个可重复过程的输出,而该过程定义了字段。

所以这个集合是一个没有人输入的数据库。它的模式存在于处理文件的人的头脑中,工作就是将其取出并将其写入表中。

本文假设第 14A 条中的诊断(三种语料库,以及构建错误语料库的成本)已经以这种形式返回:一种文档类型,许多副本。它涵盖了下一步该做什么:

生成专栏的采访,逐个问题

两个信号,用于区分真实列和稍后将破坏过滤器的字段

作为集合目录的索引,以及它不断增长的原因

每个文档一次获得的报酬,以及每个问题获得的报酬

每天 50 个问题的算术,说明什么时候准备工作就能收回成本

本文是企业文档智能第 IV 部分的一部分,该系列由四块砖构建企业 RAG 系统。第四部分是输入不再是文件而是成为文件夹的地方,这是文件夹形状,其中表格是正确的答案。

工作示例是一个保险组合,它是虚构的:客户、保单编号和金额是为该系列编写的,与真正的被保险人或保险公司不匹配。第 3.2 节提供了一个可以运行相同测试的公共文件夹。

5.结论