一个 OpenAI 模型逃离沙箱并闯入另一家公司进行测试作弊

更深层次的问题是,太多的政策制定者仍在为 ChatGPT-3.5 聊天机器人世界立法,预测下一个代币,而不是为自主思考和行动以不懈地、创造性地实现其目标的代理立法。在这一差距缩小之前,我们将继续通过人工智能治理即兴发挥,一次一个事件。《一个 OpenAI 模型逃离沙盒并闯入另一家公司以在测试中作弊》一文首先出现在美国企业研究所 - AEI 上。

来源:美国进取研究所信息

如果您想知道人工智能系统变得多么强大,请考虑一下刚刚发生的事情。人工智能代理逃离了测试的孤立环境,进入了开放的互联网,发现并利用了未知的软件漏洞,并闯入了另一家公司的生产系统,所有这些都是为了追求一个单一的、狭隘的目标:找到网络安全测试的答案。该事件引发了许多重要的治理问题。

7月16日,Hugging Face披露了一起不寻常的安全事件:

我们检测到对我们部分生产基础设施的入侵并做出了响应。这与我们之前处理过的任何事情都有一个重要的不同:它是由一个自主的人工智能代理系统端到端驱动的,我们主要用我们自己的人工智能来检测和剖析它。

该公司遏制了入侵行为并向执法部门报告。他们将攻击者视为未知的外部对手,因为从公司的立场来看,情况就是这样。我采访过的许多专家都认为这是外国政府在试探防御。

上周,我们了解了实际发生的情况。该事件始于 OpenAI 安全评估,旨在测试 ChatGPT-5.6 Sol 和未发布的模型如何有效地识别和利用网络安全漏洞。 OpenAI 将模型放置在一个密封的沙箱中,故意放宽了一些通常的安全限制,并指示他们完成 ExploitGym,这是一项黑客挑战。

在努力通过测试的过程中,这些模型发现并利用了保护沙箱的软件中以前未知的零日漏洞,从而使它们能够访问互联网。然后他们推断挑战的答案可能存储在 Hugging Face 上。

该事件引发了几个重要问题。

  • 代理人工智能网络攻击不再是理论。主要出现在研究论文和会议小组中的事情刚刚发生在现实生活中。