一个根本缺陷使法学硕士极易受到攻击

一个研究小组在本月顶级人工智能会议国际机器学习会议上发表的一篇论文中指出,由于大型语言模型工作方式存在根本性缺陷,因此不可能使大型语言模型完全免受黑客攻击。该声明对该技术的安全性具有巨大影响,其中......

来源:MIT Technology Review _人工智能

“当你和我说话时,我可以分辨出哪些词是从我嘴里说出来的,因为我能感觉到我的嘴在动,”崔说。但法学硕士只能看到连续的文本流;用户的提示与模型之前的响应、草稿本笔记、从文档复制的文本等混合在一起。 “这只是一大张代币,”她说。

为了帮助跟踪谁说了什么,聊天机器人使用标签按研究人员所说的角色来分解文本。您输入的所有内容都会放在 标签之间,LLM 写回的所有内容都会放在 标签之间。模型设计者提供的用于指导其核心行为的文本放置在 标记之间,模型在其思维链中生成的文本放置在 标记之间,模型从外部源(例如网页或另一个代理)获取的文本放置在 标记之间。 (崔说,这些是 OpenAI 为其模型使用的标签;其他公司可能使用不同的标签。但是,目的是相同的。)

角色已成为 LLM 接受黑客攻击培训的基础,因为大多数攻击归结为欺骗模型,使其表现得好像指令来自某人或某物,但实际上并非如此。例如,许多越狱(用户欺骗模型说或做其制造者不希望的事情)是通过使模型读取 文本,就像它是 或 文本一样来工作的。许多提示注入(黑客向模型发送新指令)的工作方式是让模型读取 文本,就像它是 、 或 文本一样。

当模型制作者训练法学硕士抵御攻击时,很大程度上要让模型发现指令何时出现在不该出现的地方。

弱链接

研究人员声称,结果是攻击者想要破解 LLM 所需要做的就是编写欺骗特定角色的文本。由于角色是法学硕士工作方式的基本组成部分,因此再多的培训也无法完全解决问题。