Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning
多模态大语言模型越来越多地使用视觉思维链 (Visual CoT) 来推理空间、时间和具体环境。通过生成中间推理图像,Visual CoT 为视觉预见提供了直观的机制,但引入了大量的推理开销,这对于主动视频推理来说尤其成问题。我们询问模型是否可以在训练过程中学会视觉思考,同时在推理时直接进行推理。我们引入内部化视觉思维(IVT),这是一种联合优化文本预测和……的训练后框架。