GH-ESD:实例级视觉任务的基于假设驱动的误差切片发现

视觉模型在语义相干子集上的系统性失败(称为错误切片)揭示了鲁棒性和评估的局限性。现有的切片发现方法主要将切片建模为表示空间中的簇或预定义属性的组合。虽然对于图像级分类有效,但这种公式对于对象检测和分割等实例级任务来说是不够的,在这些任务中,失败通常是由上下文关系和空间基础的视觉模式引起的。我们提出 GH-ESD(扎根假设驱动的误差切片发现),...

来源:Apple机器学习研究

视觉模型在语义相干子集上的系统性失败(称为错误切片)揭示了鲁棒性和评估的局限性。现有的切片发现方法主要将切片建模为表示空间中的簇或预定义属性的组合。虽然对于图像级分类有效,但这种公式对于对象检测和分割等实例级任务来说是不够的,在这些任务中,失败通常是由上下文关系和空间基础的视觉模式引起的。我们提出了 GH-ESD(扎根假设驱动的误差切片发现),这是一种生成和验证框架,它将切片发现重新表述为扎根假设生成和统计验证。 GH-ESD 使用 LLM 先验和接地视觉证据构建关系失败假设,通过视觉语言模型发现实例级别的假设切片,并通过实例级别错误的统计趋势分析来验证它们。我们还引入了 GESD(接地错误切片数据集),这是实例级错误切片发现的新基准,提供从检测和分割失败中得出的专家定义的空间接地切片。大量实验表明,GH-ESD 始终优于基线,在检测任务的 GESD 基准上将 Precision@10 提高了 0.10(0.73 与 0.63),同时还支持分割场景。 GH-ESD 识别可解释的切片,以促进可操作的模型改进。

* 同等贡献。