通过查询感知压缩降低 Amazon Bedrock 上的 RAG 成本

输入令牌通常是大规模运行检索增强生成 (RAG) 成本的重要组成部分。本文介绍了 Amazon Bedrock 上的查询感知上下文压缩模式:检索后,较小的模型会在主模型回答之前根据查询过滤检索到的块,从而减少输入令牌和成本,同时保持答案质量。

来源:亚马逊云科技 _机器学习

每次调用时发送到基础模型 (FM) 的输入令牌通常是大规模运行检索增强生成 (RAG) 成本的重要组成部分。查询感知压缩提供了一种减少到达模型的查询数量的方法。Amazon Bedrock 提供了构建 RAG 应用程序的基础模型和功能。 RAG 检索通常会针对高召回率进行调整,返回一组广泛的潜在相关块,以便主要模型具有完整的源材料可供使用。这种设计可以帮助构建者确信在推理时可以获得正确的信息。随着工作负载的扩展,构建者通常会寻找方法来优化成本性能权衡,方法是减少主要模型处理的输入令牌数量,同时保持答案质量。 Amazon Bedrock 的开放式可组合架构支持自定义检索后处理步骤,可优化到达主要模型的内容。

在这篇文章中,我们描述了一种检索后定制模式,该模式可显着减少输入令牌,从而节省成本,同时保持答案质量。它与 Amazon Bedrock 上的 RAG 检索器兼容,包括 Amazon Bedrock 知识库。第二个好处是,消除不相关的背景可以减少产生幻觉的表面积。在检索之后但在最终应答呼叫之前,Amazon Bedrock 上的一个更小、成本更低的模型会根据用户的查询过滤检索到的块。然后,主要模型接收过滤后的上下文并生成答案。

我们从较高层面介绍了该模式的架构,展示了 AWS Lambda 函数中的核心 Amazon Bedrock 实现,介绍了成本模型和延迟权衡,并描述了我们如何评估答案质量。我们还研究了这种模式如何叠加在现有的 Amazon Bedrock 功能(例如提示缓存、Amazon Bedrock 智能提示路由和 Rerank API)之上,以实现复合成本节省。

先决条件

  • 拥有有效的 AWS 账户。
  • 方法