详细内容或原文请订阅后点击阅览
交叉引用的循环工程:当 RAG 回答“参见第 7.2 节”而不是实际答案时
企业文档智能 [Vol.1 #11] - 当第一个答案指向文档中的其他位置时,管道循环返回以获取链接的上下文交叉引用的后循环工程:当 RAG 答案“参见第 7.2 节”而不是实际答案首先出现在《走向数据科学》上。
来源:走向数据科学为您提供以下答案:“适用的子限制在政策第 7.2 节中定义。”现在以用户身份阅读。是的……还有?第 7.2 节说了什么?实际数字是多少?答案并没有错,它还没有完成:检索到的段落指向答案而不是包含答案,并且管道中没有任何内容去获取它。合同、标准和文件中都充满了这些内部指针;问题是如何系统地遵循它们,而不是希望在第一次尝试时就获取正确的页面。
本文是企业文档智能第三部分的一部分,该系列从四个部分构建企业 RAG 系统:文档解析、问题解析、检索和生成。它构建了这种系统化的方式:解析器以廉价的方式标记引用,生成报告未解析的引用,然后编排器循环返回目标。
📓 可运行的同伴自己走两遍循环:您在注意纸上运行第 1 遍,打印第 6 页上的 LLM 标志的挂起_引用,观察解析器针对对象注册表加入“表 3 行 (E)”,并看到第 2 遍返回完成。在 GitHub 上:doc-intel/notebooks-vol1。
1. 每个积木中交叉引用的位置
引用发生在解析时(文档作者编写它)、检索时(包含引用的块与查询匹配)和生成时(模型写入“参见第 X 节”而不是获取第 X 节)。指针可以在这三个时刻中的任何一个时刻被解析,并在每个时刻默默地下降。修复方法是生成输出上的一个反馈字段,用于标记未解析的引用,再加上一个协调器来捕获信号,根据解析块的关系表解析引用,重新检索链接区域,并使用现有的链接上下文重新运行生成。
问题解析不变。用户的问题被解析为通常的question_df加上卫星(第6条)。参考文献不需要新的问题形式。
检索
