详细内容或原文请订阅后点击阅览
模型教会AI更像人类一样阅读
一个新框架帮助人工智能更好地理解复杂的视觉文档,如演示幻灯片、宣传册和报告。
来源:未来分享本文
文章
您可以根据署名4.0国际许可自由分享本文。
一种新模型教会工作场所AI更像人类一样阅读。
现代人工智能平台可以在几秒钟内总结报告、分析文档和回答问题。但当信息分布在数十张幻灯片、图表和表格中时,即使是最先进的模型也可能遗漏重要细节。
随着许多组织和企业转向AI以提高工作效率,风险仍然很高。从被忽视的脚注到误读的图形,小错误可能带来昂贵的后果。
为了应对这一挑战,佐治亚理工学院和摩根大通的研究人员开发了SlideAgent。这个新框架帮助大型语言模型更好地理解复杂的视觉文档,如演示文稿幻灯片、手册和报告。
SlideAgent通过将文档分解为多个层次来工作,允许模型同时分析全局和细节。这种受人类启发的方法比现有系统产生更准确和可靠的解释。
除了改进工作场所工具外,SlideAgent还指向AI的更广泛转变。这项工作不是只构建更大更强大的模型,而是展示了更智能的设计和更高效的推理如何提高性能。
“多模态LLM如GPT、Gemini和Claude可以节省人们的时间并减少理解这些文档所需的脑力劳动,但它们仍然不完美,”佐治亚理工学院计算科学与工程学院的博士候选人Yiqiao Jin说。
“例如,在高风险的金融领域,误读一个数字、忽视一个脚注或在页面间做出不正确的比较,都可能影响报告、风险评估或战略决策。”
研究人员在广泛的实际文档上测试了SlideAgent,包括财务演示、技术幻灯片和视觉问答数据集。
在整个评估过程中,该系统始终优于领先的商业模型和开源工具。在某些情况下,它将准确率提高了多达10%。在更复杂的任务上,如在幻灯片间比较信息或理解页面上视觉效果之间的相互关系,增益尤其显著。
“我们发现结果非常令人鼓舞。SlideAgent在其专有基础模型上提高了7.9%,在评估的开源基础模型上提高了9.8%,”项目首席研究员Jin说。
“考虑到底层多模态模型的强度和任务的难度,这些是有意义的增益。”
当前的多模态AI系统通常一次处理整个页面。这种方法可能导致错误,例如在图表中数错项目或忽视密集视觉中的重要细节。
SlideAgent通过模仿人们阅读文档的方式来解决这个问题。系统不是将每个页面视为一个单元,而是在三个层次上查看信息:整个文档、单个页面和特定元素如图表、表格和文本块。
一个代理网络——每个代理专精于特定层次——划分并协调分析。然后SlideAgent组合输出以构建对整体文档的结构化理解。这使其能够更准确地回答问题并在多个页面间进行推理。
“核心灵感来自人们自然阅读长篇演示文稿的方式,”Jin说。
“我们首先对整体叙事建立理解,然后识别相关页面或章节,最后在需要精确证据时放大到个别图表、表格或文本块。”
这项工作突显了AI日益增长的挑战。随着系统变得更加流行和强大,用户越来越多地发现技术的局限性。对于需要结构化推理和上下文理解的实际任务尤其如此。
SlideAgent表明,更好的性能并不总是来自构建更大的模型。相反,它指向了更智能地组织AI处理信息的方式,这可以带来改进。
计算语言学协会已接受SlideAgent在其年会上展示。
来源:佐治亚理工学院
