详细内容或原文请订阅后点击阅览
幻觉、水印、移除工具和被挤压的气球
水印在模型产生疑虑的时刻发挥作用,捕捉AI错误的安全检查也是如此。该文章《幻觉、水印、移除器和一个被挤压的气球》首次发表于Towards Data Science。
来源:走向数据科学AI安全存在误伤问题。证明人工智能文本来源的技术正在削弱检查文本是否真实的技术。水印或在生成的文本中嵌入隐藏签名以便以后可以证明其来源,用于提高人工智能应用的透明度(欧洲的欧盟人工智能法案第 50 条 [1];中国国家互联网信息办公室的人工智能标签规定 [2])。此外,幻觉检测试图标记模型所组成的答案的部分。我们用它来检查模型输出是否可以合理预测。监管机构正在推动这两个方面。但人工智能模型内部的透明度和责任之间存在着隐藏的冲突。碰撞隐藏在模型的内部,但可能对人工智能系统的安全产生真正的影响。
水印如何工作
法学硕士不会写句子。它在每一步都会计算下一个标记的概率分布。有时这种分布很明显。在“法国的首都是”之后,“巴黎”这个代币几乎承载了所有的概率质量,没有真正的选择可做。有时它是平坦的。在“她离开聚会是因为”之后,多个延续同样合理,并且模型掷了一枚加权硬币。该分布平坦度的技术名称是熵,或者更具体地说是语义熵 [1]。高熵意味着模型正在许多可比较的选项中进行选择。低熵意味着下一个令牌本质上是被迫的。请记住这种区别,因为这个故事中的两种技术都处于高熵位置。
Google DeepMind 的 SynthID-Text [5] 部署在其所有 Gemini 系列模型中,通过称为锦标赛采样的机制完善了这一想法(模型起草几个候选词,秘密密钥在它们之间进行淘汰;冠军被写入),用作模型输出概率的处理器。该方案在 Hugging Face Transformers 库中开源。
