MLLM关键词检索结果

了解多模式法学硕士中的一致性:综合研究

Understanding Alignment in Multimodal LLMs: A Comprehensive Study

偏好对齐已成为提高大型语言模型 (LLM) 性能的关键组成部分,但其对多模态大型语言模型 (MLLM) 的影响仍相对未得到充分研究。与语言模型类似,用于图像理解任务的 MLLM 也会遇到幻觉等挑战。在 MLLM 中,幻觉不仅可以通过陈述不正确的事实而发生,还可以通过产生与图像内容不一致的响应而发生。 MLLM 对齐的主要目标是鼓励这些模型将响应与图像信息更紧密地对齐。最近...

LVSum:时间戳感知长视频摘要的基准

LVSum: A Benchmark for Timestamp-Aware Long Video Summarization

长视频摘要对多模态大语言模型 (MLLM) 提出了重大挑战,特别是在长时间保持时间保真度以及生成语义和时间上均基于的摘要方面。我们引入了 LVSum,这是一个人工注释的基准,用于评估具有细粒度时间对齐的长格式视频摘要。 LVSum 包含 72 个不同的视频,跨越 13 个领域,平均持续时间为 16 分钟,每个视频都注释有最多 10 个包含时间参考的人工生成的摘要。 We conduct a comprehensive evaluation…

激励以自我为中心的视频理解模型中的时间意识

Incentivizing Temporal-Awareness in Egocentric Video Understanding Models

多模态大语言模型 (MLLM) 最近在视觉理解方面表现出了强大的性能,但它们往往缺乏时间意识,特别是在以自我为中心的环境中,其中推理取决于事件的正确排序和演变。这种缺陷部分源于训练目标未能明确奖励时间推理,而是依赖于帧级空间快捷方式。为了解决这个限制,我们提出了时态全局策略优化(TGPO),这是一种具有可验证奖励的强化学习(RLVR)算法,旨在激励时态……