提示工程还不够:情境工程的四块砖如何阻止 RAG 幻觉

企业文档智能 [Vol.1 #9bis] - 您的 RAG 不是幻觉,它忠实地回答了错误的上下文。在真实的 NIST 和世界银行文件中,观察四块砖块中的每一块都破裂了,以及关闭它的合同。后提示工程还不够:背景工程的四块砖块如何阻止 RAG 幻觉首先出现在《走向数据科学》上。

来源:走向数据科学

(A 部分和 B 部分)我们构建了升级后的管道并观察它的工作情况:指向一篇研究论文、一项 NIST 标准和一份目录不完整的报告,它每次都会返回一个打印的引用答案。那么为什么它有效呢?一个天真的 RAG,几乎每个人都首先构建的那种,嵌入页面,保留最近的几个,问,会做同样的事情吗?

本文将两者并列运行。简短的答案是否定的,有用的部分是天真的突破的地方:不是在一个地方,而是在四个砖块中的每一块依次进行文档解析、问题解析、检索和生成,每次都有一个你可以命名和修复的原因。

这也是为什么通常的反应——重写提示、缩小块、交换嵌入模型——没有帮助。错误答案并非来自提示。它来自上游的一块砖,向模型传递了错误的上下文,然后模型忠实地回答了这个问题。正确处理所有四个块,而不仅仅是提示,就是本系列所说的上下文工程。下面的每一次失败都是真实的运行,而不是假设的;配套笔记本重现了每一个。第 7 条之五(大多数 RAG 幻觉是检索失败)在一份文档的检索级别上提出了相同的情况;这个在所有四块砖上都显示了这一点。

📓本文的可运行笔记本位于 GitHub 上:doc-intel/notebooks-vol1。它在下面的每个文档上并排运行朴素基线和升级后的 pdf_qa,自信地打印两个答案,并在您自己的机器上重现图中的每个十字。

1. 朴素基线,一砖一瓦

基线是第 1 条中的 100 行管道(最小 RAG):解析 PDF,将问题转化为关键字,通过匹配保留前几页,要求模型回答。在一篇简短、干净、散文的论文上它是有效的,Article 9 自己的测试也证实了这一点:在《Attention Is All You Need》和 RAG 论文上,naive 和升级版都给出了正确的答案。

2. 解析:扁平化为噪音的表格

6. 一根四门