On Robustness and Chain-of-Thought Consistency of RL-Finetuned VLMs
强化学习 (RL) 微调已成为增强推理密集型任务的大型语言模型 (LLM) 的关键技术,并推动其扩展到视觉语言模型 (VLM)。虽然经过 RL 调整的 VLM 改进了视觉推理基准,但它们仍然容易受到视觉基础薄弱、幻觉和过度依赖文本提示的影响。我们证明,简单的、受控的文本扰动——误导性的标题或不正确的思维链 (CoT) 痕迹——会导致鲁棒性和置信度大幅下降,并且当 CoT 一致性为……时,这些影响会更加明显。
GH-ESD: Grounded Hypothesis-Driven Error Slice Discovery for Instance-Level Vision Tasks
视觉模型在语义相干子集上的系统性失败(称为错误切片)揭示了鲁棒性和评估的局限性。现有的切片发现方法主要将切片建模为表示空间中的簇或预定义属性的组合。虽然对于图像级分类有效,但这种公式对于对象检测和分割等实例级任务来说是不够的,在这些任务中,失败通常是由上下文关系和空间基础的视觉模式引起的。我们提出 GH-ESD(扎根假设驱动的误差切片发现),...
Anti-Causal Domain Generalization: Leveraging Unlabeled Data
领域泛化问题涉及学习预测模型,这些模型在部署到以前未见过的新环境中时对分布变化具有鲁棒性。现有方法通常需要来自多个训练环境的标记数据,当标记数据稀缺时限制了它们的适用性。在这项工作中,我们研究反因果环境中的领域泛化,其中结果导致观察到的协变量。在这种结构下,影响协变量的环境扰动不会传播到结果,这会促使模型对……的敏感性进行正则化。