详细内容或原文请订阅后点击阅览
超越视觉CoT:面向主动视频推理的内化视觉思维
多模态大语言模型越来越多地使用视觉思维链 (Visual CoT) 来推理空间、时间和具体环境。通过生成中间推理图像,Visual CoT 为视觉预见提供了直观的机制,但引入了大量的推理开销,这对于主动视频推理来说尤其成问题。我们询问模型是否可以在训练过程中学会视觉思考,同时在推理时直接进行推理。我们引入内部化视觉思维(IVT),这是一种联合优化文本预测和……的训练后框架。
来源:Apple机器学习研究多模态大语言模型越来越多地使用视觉思维链来推理空间、时间和具身环境。通过生成中间推理图像,视觉思维链提供了一种直观的视觉前瞻机制,但引入了大量的推理开销,这对于主动视频推理尤其成问题。我们询问模型是否可以在训练期间学习视觉思考,而在推理时直接进行推理。我们引入了内化视觉思维,一个后训练框架,联合优化未标记视频上的文本预测和下一嵌入预测。给定一个部分观察的视频,IVT预测未来帧的潜在表示以及目标文本答案,鼓励模型捕捉运动、对象转换、交互和潜在意图。在推理时,IVT直接生成答案,无需合成或重新编码未来帧。我们在目标表示、解码器设计、预测范围、数据混合、训练课程和预测目标上进行了受控研究。IVT在所有六种评估设置中都优于纯文本后训练,同时保留了相同的有效推理路径。与视觉思维链相比,IVT实现了相当或更好的性能,并将端到端延迟减少了5倍以上。我们的发现表明,在推理时使用显式像素空间生成(如视觉思维链中所用)对于主动视频推理可能并非必要。预测性世界建模可以在训练期间内化,以产生更准确且效率显著更高的多模态推理器。
