解析文件夹,而不仅仅是 PDF:案例文件中 RAG 需要的关系表

企业文档智能 [Vol.1 #14D] - 索引列出了打开任何文件夹之前案例类型的要求,并且值得构建的两个问题根本不是检索问题帖子解析文件夹,而不仅仅是 PDF:案例文件中 RAG 需要的关系表首先出现在走向数据科学上。

来源:走向数据科学

更长,并且随之而来的建议很简单:停止检索,将整个内容放入提示中。

在案件卷宗中,该建议几乎有效。关于一项保险索赔的 11 个 PDF 长达 60 多页,可以多次容纳 200,000 个代币的窗口。

它仍然遗漏了处理索赔的人员提出的两个问题。第二张维修发票是否在文件夹中,索赔表上的丢失日期是否与理赔员报告中的日期相符?

原因在于事物的形状。案例文件是关于一个实体的一组不同的文档,工作单元就是该包。索赔、信用申请、医疗记录、雇用档案。合同、证书、照片、专家报告、信件:里面没有任何东西相似,答案来自于阅读所有这些。

所以这两个问题都不是搜索。第一个是关于一个不存在的文档,并且没有任何上下文可以容纳它。第二个需要比较两个文件中每个文件的一个值。模型读取长输入的中间部分的可靠性不如读取末端的部分,这一点已经被测量过。在十一个捆绑包中,两个值都位于中间。

本文将介绍所发生的变化:

  • 是什么将案例文件与较小的集合区分开来
  • 案例类型期望的片段列表,它索引应该存在的内容而不是实际存在的内容
  • 为什么缺失的文档是一流的答案,以及如何生成一个
  • 将一个片段与另一个片段进行比较的检查,以及它们首先需要的键入值
  • 答案的形状,是案例的状态而不是一段文字
  • 为什么这种形状是三种形状中现有技术最少的,以及如何评估它
  • 本文是企业文档智能第 IV 部分的一部分,该系列由四块砖构建企业 RAG 系统。第四部分是输入不再是文件而是文件夹,并且该文件夹的行为就像一个对象而不是集合。