详细内容或原文请订阅后点击阅览
展示示例:从图像集中推断视觉概念
视觉语言模型 (VLM) 可以遵循复杂的文本指令,但它们很难从纯粹的视觉上下文中进行推理。特别是,当前的模型无法从示例图像集中推断出共享概念并将其应用于新的输入。我们引入了集合视觉概念推理(VICIS),这是一项评估这种能力的任务。给定共享概念和查询图像的一小部分上下文图像,模型必须生成新图像,以保留上下文定义的概念,同时与查询保持一致。我们证明最先进的 VLM 在这项任务上表现不佳......
来源:Apple机器学习研究视觉语言模型 (VLM) 可以遵循复杂的文本指令,但它们很难从纯粹的视觉上下文中进行推理。特别是,当前的模型无法从示例图像集中推断出共享概念并将其应用于新的输入。我们引入了集合视觉概念推理(VICIS),这是一项评估这种能力的任务。给定共享概念和查询图像的一小部分上下文图像,模型必须生成新图像,以保留上下文定义的概念,同时与查询保持一致。我们表明,最先进的 VLM 在这项任务上表现不佳,经常忽略视觉上下文或默认为有偏见的生成。为了解决这一差距,我们提出了一种训练框架和架构,可以学习从图像集中推断视觉概念并从查询中提取特定于概念的嵌入。对合成数据和大规模 ImageNet/WordNet 数据的实验表明,我们的模型生成更准确和多样化的输出,并泛化到看不见的概念和模式,例如草图。
