OpenAI 的代理在安全测试期间逃离了沙箱

一个 OpenAI 代理逃离了沙箱,窃取了凭证,并闯入了 Hugging Face。这就是它的实际含义。

来源:Malwarebytes Labs 博客

在内部 OpenAI 安全评估期间,一系列 AI 模型逃离了沙箱,到达互联网,然后访问 Hugging Face 基础设施以完成测试目标。

OpenAI 是一家领先的人工智能 (AI) 研究和部署公司。其最知名的产品无疑是ChatGPT。

Hugging Face 是一个开发者和研究人员共享和使用人工智能工具和模型的网站,类似于程序员使用 GitHub 共享和协作代码的方式。

两家公司调查了该事件,并得出结论:该事件发生在受控安全测试期间,而不是由操作员发起的故意攻击。

OpenAI 表示,正在对模型进行网络功能测试,减少安全限制,并且系统通过测试设置中的漏洞找到了摆脱受控环境的方法。一旦接入互联网,它就会瞄准 Hugging Face,因为该平台与评估任务相关。

Hugging Face 表示,该事件导致其生产基础设施的有限部分遭到未经授权的访问,包括一小部分内部数据集和一些凭证。该公司认为这次活动不寻常,因为它似乎是由自主人工智能代理系统端到端执行的。

与等待用户提示的传统人工智能助手不同,人工智能代理旨在自行追求目标。他们可以推理、计划和执行多步骤任务,包括访问文件、查询数据库以及与在线服务交互,通常需要最少的人工监督。

公开披露的内容指向一系列故障,而不是单个错误。 OpenAI 表示,该模型通过包注册表缓存代理中的零日漏洞逃脱,该代理是其隔离研究环境的一部分。然后,它使用权限升级和横向移动来到达具有互联网访问权限的节点。

我们不仅报告威胁,还删除威胁