详细内容或原文请订阅后点击阅览
通过减少 LLM 调用而不是购买更快的模型来降低企业 RAG 管道的延迟和成本
企业文档智能 [Vol.1 #9ter] - 第 9 条中的管道分几个步骤调用模型以确保其正确。对于简单的问题,这是不必要的延迟。每个问题的信号都会引导他们通过模型,为关键字匹配节省大约两秒的时间。通过减少 LLM 的调用,而不是通过购买更快的模型来降低企业 RAG 管道的延迟和成本,该帖子首先出现在《走向数据科学》上。
来源:走向数据科学是以代理方式构建的:在决策需要判断的地方放置一个模型,并让它做出决定。这意味着大量的模型调用。第 9 条中的管道(PDF 的生产 RAG 管道)的构建方式与此完全相同。问“年度保费是多少?”,它会连续运行三个模型调用:
每次通话都会购买一些真实的东西。在检索运行之前,解析调用会吸收拼写错误和模糊的措辞。仲裁器调用可防止错误页面到达生成层。生成调用返回一个键入的答案,其中包含您可以在页面上检查的报价。对于一个难题,这三个调用使答案值得信赖,这就是为什么第 9 条将它们放在那里。
问题是我们无法在每个问题上都这样做,因为它很慢。连续三个呼叫意味着用户等待大约两秒钟,并针对每个问题(包括简单的问题)支付代币。许多企业问题从来都不难:“年度保费是多少?”在一行中只有一个答案,并且确定性关键字匹配已经在第一次通过时将其隔离。因此,本文添加了一个路由器:一个廉价的每个问题信号,在任何模型调用之前读取,它将简单的问题沿着快速路径发送,并将所有三个调用保留为困难的问题。本文是该路由的映射:信号(管道已经计算出的分数)、使其诚实的余量、它节省的内容(关键字匹配大约两秒)以及它必须拒绝快速路径的问题。每个数字都是虚构经纪人语料库上的真实运行结果,可在配套笔记本中重现。
📓本文的可运行笔记本位于 GitHub 上:doc-intel/notebooks-vol1。它在经纪人语料库上运行路由器,打印每个问题的置信度分数,并显示哪些问题跳过模型,哪些保留模型。
