详细内容或原文请订阅后点击阅览
LVSum:时间戳感知长视频摘要的基准
长视频摘要对多模态大语言模型 (MLLM) 提出了重大挑战,特别是在长时间保持时间保真度以及生成语义和时间上均基于的摘要方面。我们引入了 LVSum,这是一个人工注释的基准,用于评估具有细粒度时间对齐的长格式视频摘要。 LVSum 包含 72 个不同的视频,跨越 13 个领域,平均持续时间为 16 分钟,每个视频都注释有最多 10 个包含时间参考的人工生成的摘要。 We conduct a comprehensive evaluation…
来源:Apple机器学习研究长视频摘要对多模态大语言模型 (MLLM) 提出了重大挑战,特别是在长时间保持时间保真度以及生成语义和时间上均基于的摘要方面。我们引入了 LVSum,这是一个人工注释的基准,用于评估具有细粒度时间对齐的长格式视频摘要。 LVSum 包含 72 个不同的视频,跨越 13 个领域,平均持续时间为 16 分钟,每个视频都注释有最多 10 个包含时间参考的人工生成的摘要。我们使用新推出的基于 LLM 的内容相关性和模态一致性指标以及标准自动指标,对领先的专有和开源 MLLM 进行全面评估。我们的实验揭示了三个关键发现:(1)转录本对摘要质量的贡献远大于单独的视觉框架,(2)模型生成的摘要和人类编写的摘要之间仍然存在显着的性能差距,(3)当前的 MLLM 在时间基础、指令依从性和跨模式一致性方面表现出系统性弱点。
