保真度关键词检索结果

STARFlow2:连接语言模型和归一化流以实现统一多模态生成

STARFlow2: Bridging Language Models and Normalizing Flows for Unified Multimodal Generation

能够理解、推理和生成交错文本-图像序列的统一多模态模型在结构上仍然分散:现有方法要么通过离散标记化牺牲视觉保真度,要么通过组合不同的模态施加结构不对称性。

超越 RAG:AWS 上企业 AI 的任务感知知识压缩

Beyond RAG: Task-aware knowledge compression for enterprise AI on AWS

传统 RAG 在跨越数百个文档的分析任务上遇到了上限。本文展示了如何使用 AWS 上的任务感知知识压缩 (TAKC) 将整个知识库预先压缩为特定于任务的表示形式,将它们缓存在多个保真度层,并将每个查询路由到正确的层,并使用您可以部署的开源实现。

LVSum:时间戳感知长视频摘要的基准

LVSum: A Benchmark for Timestamp-Aware Long Video Summarization

长视频摘要对多模态大语言模型 (MLLM) 提出了重大挑战,特别是在长时间保持时间保真度以及生成语义和时间上均基于的摘要方面。我们引入了 LVSum,这是一个人工注释的基准,用于评估具有细粒度时间对齐的长格式视频摘要。 LVSum 包含 72 个不同的视频,跨越 13 个领域,平均持续时间为 16 分钟,每个视频都注释有最多 10 个包含时间参考的人工生成的摘要。 We conduct a comprehensive evaluation…