详细内容或原文请订阅后点击阅览
DeepAmbigQA:用于 LLM 答案完整性基准测试的模糊多跳问题
具有集成搜索工具的大型语言模型 (LLM) 在开放域问答 (QA) 方面显示出强大的前景,但它们常常难以为复杂问题提供完整的答案,例如“电影《热火》中的哪位演员至少赢得了一项奥斯卡奖?”,这需要 (1) 区分多部具有相同标题的电影,以及 (2) 对大量演员进行推理以收集和整合证据。现有的质量保证基准很少联合评估这两个挑战。为了解决这个问题,我们引入了 DEEPAMBIGQAGEN,一个自动数据生成管道,用于构建 QA...
来源:Apple机器学习研究具有集成搜索工具的大型语言模型 (LLM) 在开放域问答 (QA) 方面显示出强大的前景,但它们常常难以为复杂问题提供完整的答案,例如“电影《热火》中的哪位演员至少赢得了一项奥斯卡奖?”,这需要 (1) 区分多部具有相同标题的电影,以及 (2) 对大量演员进行推理以收集和整合证据。现有的质量保证基准很少联合评估这两个挑战。为了解决这个问题,我们引入了 DEEPAMBIGQAGEN,这是一种自动数据生成管道,它构建基于文本语料库和链接知识图的 QA 任务,生成自然且可验证的问题,系统地嵌入名称歧义和多步骤推理。在此基础上,我们构建了 DEEPAMBIGQA,这是一个包含 3,600 个需要多跳推理的问题的数据集,其中一半需要显式名称歧义解决。实验表明,即使是最先进的 GPT-5 也显示不完整的答案,在模糊问题上仅实现 0.13 的精确匹配,在非模糊问题上仅实现 0.21 的精确匹配。这些发现强调需要更强大的 QA 系统来收集信息并保证答案的完整性。
