多模态评估器:MLLM 作为 Strands Evals 中图像到文本任务的法官

如果您正在构建视觉购物、图像或文档理解或图表分析,您需要一种方法来验证模型的响应是否确实基于源图像。纯文本评估器无法告诉您标题是否忠实地描述了图像、提取的发票总额是否与文档匹配、或者屏幕摘要是否[...]

来源:亚马逊云科技 _机器学习

如果您正在构建视觉购物、图像或文档理解或图表分析,您需要一种方法来验证模型的响应是否确实基于源图像。纯文本评估器无法告诉您标题是否忠实地描述了图像,提取的发票总额是否与文档匹配,或者屏幕摘要是否幻觉了页面上从未出现过的按钮。 Gartner 预测,到 2030 年,80% 的企业软件将采用多模式,而 2024 年这一数字将不足 10%。如果没有自动化多模式评估,您将陷入昂贵的人工审查和不可靠的纯文本代理之间。

今天,我们在 Strands Evals 软件开发套件 (SDK) 中宣布推出四种新的多模态大语言模型 (MLLM) 评估器,用于图像到文本任务:整体质量、正确性、忠实性和指令遵循。每个评估器根据源图像对图像到文本的输出进行评分。评估者将图像与查询、响应和(可选)参考答案一起直接发送到多模式判断模型。法官返回基于图像的分数,以及可用于调试的推理字符串。您可以使用这些评估器作为现有 Strands Evals 案例→实验→报告工作流程中纯文本法官的直接替代品,并将它们插入持续集成 (CI) 以自动捕获视觉幻觉、事实错误和指令违规。

在这篇文章中,您将学习如何:

  • 设置四个多模式评估器并在图像到文本任务上运行它们。
  • 使用同一评估器在基于参考和无参考评估之间切换。
  • 为特定领域的标准编写自定义多模式标题。
  • 在 Amazon Bedrock 上选择一个平衡准确性、成本和延迟的判断模型。
  • 在我们的实验中应用提示设计选择,以改善法官与人类的一致性。
  • 先决条件

    要按照本文中的演练进行操作,您需要:

  • 有权访问 Amazon Bedrock 的 AWS 账户。