详细内容或原文请订阅后点击阅览
OpenAI 7 月份的突破远比最初意识到的复杂
数百名人工智能特工联手逃离容器,伪装自己的行动,甚至牺牲自己。
来源:美国防务一号网调查人员发现,7 月份成为头条新闻的人工智能突破比之前意识到的要复杂得多。
根据研究非营利组织 METR 最近发布的一篇文章,数百名 OpenAI 代理在攻击广泛使用的开源代码库 Hugging Face 时联手突破容器,伪装自己的行为,甚至牺牲自己。
共同领导该调查的 METR 研究员 Ajeya Cotra 写道,“这起事件比之前的人工智能代理行为方式更严重、更复杂”。
该报告引起了专家们的警惕,他们警告说,未来基于人工智能的黑客攻击可能会让 7 月份涉及 Anthropic 和 OpenAI 的突破看起来很奇怪。
即使大型人工智能公司弄清楚如何制造可靠的护栏,他们的产品通常也只比开放权重模型提前几个月,可以免费下载和修改使用。
人工智能倡导组织 Encode AI 的总法律顾问 Nathan Calvin 在 X 上写道:“按照我们当前的发展轨迹……一个与 OpenAI 的内部模型一样强大的模型,该模型执行了 [Hugging Face] 黑客攻击,将在没有护栏的情况下广泛使用,网络犯罪分子会要求它‘以任何必要的方式为我赚钱。’”
Calvin 补充道:“然后,会有大量的人……将不断遭到黑客攻击。” METR 研究人员写道,这一事件远远超出了 7 月份人工智能代理访问互联网的事件范围。数百个代理“开发了一种方法来破解其容器并完全替换系统的一部分以执行工具调用”,即读取和写入文件、访问网页或执行其他数字任务的命令。
“这使得他们可以假装发出一个工具调用,而实际上运行他们选择的任意其他工具调用。”这意味着人工智能可以假装运行命令来查看网页,而实际上运行完全不同的命令,例如删除不相关的文件。
研究人员写道,特工本身并无意犯罪。相反,他们“似乎主要是”了解如何在实验中获得尽可能高的分数,包括花费大量时间试图欺骗评分机制以接受作弊。
METR 的 Cotra 写道:“再次发生这样的跳跃可能会让我们陷入非常危险的境地……在很多方面,我们仍然只触及了这些特工的行为和原因的表面。”
在 Hugging Face,公司工程师尝试使用 OpenAI 工具来了解他们的安全性是如何被代理群击败的,但遭到 OpenAI 防止滥用的防护措施的阻止。因此他们转向了中国的开放重量模型。
“使用生产版 ChatGPT 工具和系统提示时,破坏基础设施的可能性会下降 100 倍以上,”该公司在黑客攻击后的一份声明中表示。 Hugging Face 联合创始人兼首席科学官 Thomas Wolf 于 8 月 5 日在 X 上写道,“虽然我们可以在 API/部署级别强加这些应对解决方案,但提前将它们强加给使用开源模型的所有参与者比较困难。不过,目前开源模型略低于前沿水平,尚未表现出任何欺骗人类的倾向。”
“如果匿名性仍然相当高,我认为存在大量此类模型可能具有很大的破坏性。也就是说,我不确定我们可以采取什么措施来阻止它,”Shea-Blymyer 说。
用于黑客攻击的人工智能代理可能会让各国难以确定谁是新网络攻击的幕后黑手,因为它们消除了调查人员用来确定黑客来源的风格线索。安全与新兴技术中心研究员科林·谢伊-布莱迈尔 (Colin Shea-Blymyer) 表示:“我们判断谁发起攻击的方法之一是通过他们使用的策略……比如‘哦,这是典型的俄罗斯策略。哦,这看起来像是中国[演员]会使用的策略。’如果每个人都使用特工……使用相同的策略,那么,谁知道谁又在做什么呢?”
