评估 AI 代理:使用 Strands 和 AgentCore 的生产蓝图

Motorway 和 AWS 共同构建了一个端到端评估管道,将错误结果从八分之一的查询减少到五十分之一,并将问题检测时间从几小时缩短到几分钟。该管道将​​ Strands Agents SDK 与 Amazon Bedrock AgentCore 相结合,这是一项用于大规模部署和操作 AI 代理的完全托管服务。在这篇文章中,您将学习如何为您自己的代理构建此管道。

来源:亚马逊云科技 _机器学习

本文是与 Motorway 以及 AWS 原型和 AI 客户工程 (PACE) 团队共同撰写的。

Motorway 是一家总部位于英国的在线汽车市场,每天都会进行拍卖,多达 8,000 名经销商竞标多达 2,500 辆汽车。 Motorway 与 AWS Prototyping 和 AI Customer Engineering (PACE) 合作构建了一个由 AI 驱动的经销商库存搜索代理,该代理改变了经销商查找车辆的方式,用自然语言查询取代了数小时的手动筛选。

挑战

代理给出了听起来很自信的回答,但是你如何证明它在真钱投入的情况下可靠地工作呢?

  • 工具选择错误导致搜索结果错误,削弱经销商的信任。
  • 语义搜索误解返回不相关的结果。像“车龄不超过 5 年的汽油、混合动力和电动汽车”这样的查询要求代理正确解析多个约束。
  • 多轮对话中的上下文漂移会失去经销商的改进。
  • 不确定性输出使得单次试验测试不可靠。
  • 解决方案

    Motorway 和 AWS 共同构建了一个端到端评估管道,将错误结果从八分之一的查询减少到五十分之一,并将问题检测时间从几小时缩短到几分钟。

    该管道将 Strands Agents SDK 与 Amazon Bedrock AgentCore 相结合,这是一项用于大规模部署和操作 AI 代理的完全托管服务。在这篇文章中,您将学习如何为您自己的代理构建此管道:

  • 两阶段评估策略,涵盖使用strands-agents-evals(Strands Agents 的开源评估库)进行构建时测试和使用 Amazon Bedrock AgentCore 评估进行生产监控。
  • 用于评估工具使用、推理和输出质量的三层框架。
  • 具有质量关卡的五阶段部署管道,当指标低于阈值时会阻止发布。
  • 先决条件

    您必须满足以下先决条件才能完成这篇文章。

    完成时间:初始部署 30-45 分钟,针对您的域进行自定义需要 2-3 小时。

    三种类型的评分者