详细内容或原文请订阅后点击阅览
多模态评估器:MLLM 作为 Strands Evals 中图像到文本任务的法官
如果您正在构建视觉购物、图像或文档理解或图表分析,您需要一种方法来验证模型的响应是否确实基于源图像。纯文本评估器无法告诉您标题是否忠实地描述了图像、提取的发票总额是否与文档匹配、或者屏幕摘要是否[...]
来源:亚马逊云科技 _机器学习如果您正在构建视觉购物、图像或文档理解或图表分析,您需要一种方法来验证模型的响应是否确实基于源图像。纯文本评估器无法告诉您标题是否忠实地描述了图像,提取的发票总额是否与文档匹配,或者屏幕摘要是否幻觉了页面上从未出现过的按钮。 Gartner 预测,到 2030 年,80% 的企业软件将采用多模式,而 2024 年这一数字将不足 10%。如果没有自动化多模式评估,您将陷入昂贵的人工审查和不可靠的纯文本代理之间。
今天,我们在 Strands Evals 软件开发套件 (SDK) 中宣布推出四种新的多模态大语言模型 (MLLM) 评估器,用于图像到文本任务:整体质量、正确性、忠实性和指令遵循。每个评估器根据源图像对图像到文本的输出进行评分。评估者将图像与查询、响应和(可选)参考答案一起直接发送到多模式判断模型。法官返回基于图像的分数,以及可用于调试的推理字符串。您可以使用这些评估器作为现有 Strands Evals 案例→实验→报告工作流程中纯文本法官的直接替代品,并将它们插入持续集成 (CI) 以自动捕获视觉幻觉、事实错误和指令违规。
在这篇文章中,您将学习如何:
先决条件
要按照本文中的演练进行操作,您需要:
