OpenAI 的流氓代理在 Hugging Face 黑客攻击中到底做了什么

该代理所追求的目标远远超出了研究人员的预期,揭示了遏制强大的人工智能系统是多么困难

来源:科学美国人

由 OpenAI 模型支持的自主代理如此积极地追求网络安全基准,以至于它逃离了测试环境并闯入了 Hugging Face(人工智能模型和数据集的在线中心)。

OpenAI 在一份公开声明中称该事件“史无前例”。头条新闻将这名特工描述为“流氓”——暗示其叛逆或变得恶意。但专家表示,现实情况要复杂得多。

“这真的是失控吗?不,”英国萨里大学网络安全客座教授艾伦·伍德沃德 (Alan Woodward) 说道。 “它被要求做某事,它就这么做了。它并没有变得无赖。基本上,它摆脱困境的方法就是作弊。”

关于支持科学新闻

如果您喜欢这篇文章,请考虑通过订阅来支持我们屡获殊荣的新闻事业。通过购买订阅,您将有助于确保有关塑造当今世界的发现和想法的影响力故事的未来。

OpenAI 正在评估 GPT-5.6 Sol 以及 ExploitGym 上一个功能更强大、未发布的模型,ExploitGym 是衡量模型是否可以利用已知软件漏洞的基准。为了充分了解他们的能力,该公司放松了通常阻止危险黑客攻击的保护措施。该代理发现了一条意想不到的路线,离开了原本要隔离的环境,到达了互联网,并闯入了 Hugging Face,以获取基准测试的隐藏答案。 OpenAI 和 Hugging Face 均未立即回应对本文发表评论的请求。

伍德沃德说,特工并没有发明一种全新的黑客方法。最突出的是它能够将多个漏洞结合起来,并在实时系统中不断追求其目标。他说,允许它走到这一步“在某些方面可能有点鲁莽”。

Saxe 说,变化的是正在测试的模型的能力。它们已经变得足够强大,足以使评估失败蔓延到实际系统中。

是时候捍卫科学了