详细内容或原文请订阅后点击阅览
解析文件夹,而不仅仅是 PDF:案例文件中 RAG 需要的关系表
企业文档智能 [Vol.1 #14D] - 索引列出了打开任何文件夹之前案例类型的要求,并且值得构建的两个问题根本不是检索问题帖子解析文件夹,而不仅仅是 PDF:案例文件中 RAG 需要的关系表首先出现在走向数据科学上。
来源:走向数据科学更长,并且随之而来的建议很简单:停止检索,将整个内容放入提示中。
在案件卷宗中,该建议几乎有效。关于一项保险索赔的 11 个 PDF 长达 60 多页,可以多次容纳 200,000 个代币的窗口。
它仍然遗漏了处理索赔的人员提出的两个问题。第二张维修发票是否在文件夹中,索赔表上的丢失日期是否与理赔员报告中的日期相符?
原因在于事物的形状。案例文件是关于一个实体的一组不同的文档,工作单元就是该包。索赔、信用申请、医疗记录、雇用档案。合同、证书、照片、专家报告、信件:里面没有任何东西相似,答案来自于阅读所有这些。
所以这两个问题都不是搜索。第一个是关于一个不存在的文档,并且没有任何上下文可以容纳它。第二个需要比较两个文件中每个文件的一个值。模型读取长输入的中间部分的可靠性不如读取末端的部分,这一点已经被测量过。在十一个捆绑包中,两个值都位于中间。
本文将介绍所发生的变化:
本文是企业文档智能第 IV 部分的一部分,该系列由四块砖构建企业 RAG 系统。第四部分是输入不再是文件而是文件夹,并且该文件夹的行为就像一个对象而不是集合。
