摘要的关键词检索结果

LVSum:时间戳感知长视频摘要的基准

LVSum: A Benchmark for Timestamp-Aware Long Video Summarization

长视频摘要对多模态大语言模型 (MLLM) 提出了重大挑战,特别是在长时间保持时间保真度以及生成语义和时间上均基于的摘要方面。我们引入了 LVSum,这是一个人工注释的基准,用于评估具有细粒度时间对齐的长格式视频摘要。 LVSum 包含 72 个不同的视频,跨越 13 个领域,平均持续时间为 16 分钟,每个视频都注释有最多 10 个包含时间参考的人工生成的摘要。 We conduct a comprehensive evaluation…

教导法学硕士更新信念,实现高效的长期互动

Teaching LLMs to Update Beliefs for Efficient Long-Horizon Interaction

ABBEL 与传统递归摘要相比的概述。信念取代了完整的交互历史作为代理的工作环境,信念分级通过监督每个信念状态的内容来提高性能。随着任务范围的增长,LLM 环境无法永远扩展。自总结可以实现简洁、可解释的上下文,但会带来显着的性能成本,特别是对于高质量数据稀缺的人工辅助领域,例如协作代码生成。我们用 ABBEL 来解决这个问题:一个框架,以自然语言信念状态的形式隔离和监督摘要的信息内容。动机:递归摘要的成本对于语言模型来说,要有效地协助日益复杂的任务,例如软件开发,它们必须能够与我们进行数百甚至数千个步骤的交互。对于如此长的任务,将整个交互的历史记录保存在上下文中是不切实际的。迄今为止使用的启发