使用 GraphEval 进行语言模型幻觉评估

将 GraphEval 的关键原理和方法阶段转化为模拟的实际场景,以更好地理解其在理解和对抗 LLM 幻觉方面的用处和关键含义。

来源:KDnuggets

简介

幻觉是大型语言模型 (LLM) 在生成响应时可能遇到的最著名问题之一。当模型产生的响应实际上不正确、无意义或只是编造时,就会发生这种情况,通常是由于模型缺乏有关该问题的内部知识。

尽管近年来出现了许多解决模型幻觉问题的解决方案,但用于内部诊断模型幻觉的方法评估框架的研究相对较少。亚马逊研究人员最近的一项研究建议使用知识图作为分析和检测法学硕士中发生的幻觉的手段。该研究中提出的框架名为 GraphEval。

在本文中,我们将采用一种温和、实用的方法,通过一个基于模拟的轻量级代码示例来说明 GraphEval 的概念构建块,您可以轻松地在自己的机器上尝试该示例。

GraphEval 简而言之

GraphEval 利用知识图来识别和发出 LLM 生成的输出中的幻觉。与提供单一分数来评估准确性、确定性等方面的经典性能指标不同,GraphEval 采用强调可解释性的两阶段评估过程,即提供对幻觉确切发生位置的见解。

为此,GraphEval 考虑两个阶段:

  • 从生成的模型响应构建知识图。该图由(主题、关系、客体)形式的语义三元组组成,其中主题和客体对应于节点,关系对应于连接这些节点的边。
  • 通过自然语言推理 (NLI) 模型根据源上下文(真实知识体系)评估构建的知识图中的每个三元组。根据 NLI 引擎,任何不能被上下文包含的三元组——因为它是矛盾的或中立的——都被标记为幻觉。
  • 通过代码示例说明 GraphEval

    输出: