On Robustness and Chain-of-Thought Consistency of RL-Finetuned VLMs
强化学习 (RL) 微调已成为增强推理密集型任务的大型语言模型 (LLM) 的关键技术,并推动其扩展到视觉语言模型 (VLM)。虽然经过 RL 调整的 VLM 改进了视觉推理基准,但它们仍然容易受到视觉基础薄弱、幻觉和过度依赖文本提示的影响。我们证明,简单的、受控的文本扰动——误导性的标题或不正确的思维链 (CoT) 痕迹——会导致鲁棒性和置信度大幅下降,并且当 CoT 一致性为……时,这些影响会更加明显。
Anti-Causal Domain Generalization: Leveraging Unlabeled Data
领域泛化问题涉及学习预测模型,这些模型在部署到以前未见过的新环境中时对分布变化具有鲁棒性。现有方法通常需要来自多个训练环境的标记数据,当标记数据稀缺时限制了它们的适用性。在这项工作中,我们研究反因果环境中的领域泛化,其中结果导致观察到的协变量。在这种结构下,影响协变量的环境扰动不会传播到结果,这会促使模型对……的敏感性进行正则化。