详细内容或原文请订阅后点击阅览
十不是一百
欺骗所有幻觉探测器的数字“十不是一百”的帖子首先出现在《迈向数据科学》上。
来源:走向数据科学问题
在其客户服务聊天背后。用户询问发票。检索到的文件称应付总额为 10,000 美元。聊天机器人告诉客户总额为 1,000 美元。
如果你回顾它(并且你不是法学硕士),你会在一秒钟内看到问题,并且你不需要金融学位。该银行有专门针对此问题的审查渠道。它使用规则和法学硕士法官。法官将答案分成多个陈述,并问自己每个陈述是否都符合上下文。它衡量意义。而在意义所在的空间里,“总计1000美元”和“总计10000美元”几乎是同一句话。
我花了一周的时间来衡量当今可用的标准幻觉工具如何处理这个问题。然后我花了第二周的时间来研究这个问题下面的问题:它们中的任何一个是否在生产系统实际运行的操作点上工作。
第二周的简短版本是答案是否定的。不是训练有素的检测器,不是法学硕士法官,不是蕴涵模型,也不是我构建的东西。我将向您展示整个网格,包括我丢失的单元格。
动手
我使用了 RAGTruth [1],这是一个真实 RAG 答案的公共语料库,并构建了一个简单的集合:一百个长的、接地气的答案(与源文档所说的内容相匹配的答案),每个答案都有一个副本,其答案完全相同,但一个数字更改为源文档中任何地方都没有出现的值。交换、添加或删除了一个数字——文档中说 10,000 的地方是 1,000,文档说 53 的地方是 35。与上面相同的错误,有 200 次。我自己构建了这个集合,在这篇文章的后面我描述了一种方法,其重点是检查数字。
我使用了五个系列的探测器,每个系列都有不同的方法。
结果几乎一致。
五个探测器中有四个没有发现问题。只有 MinCheck 显示出适度的信号。
为什么他们会错过它?因为他们都在回答不同的问题。
