详细内容或原文请订阅后点击阅览
当人工智能变得流氓时
计算机安全专家表示,最近的 OpenAI、Anthropic 违规行为凸显了平衡安全性和开发速度的监管需求
来源:哈佛大学报它已成为现实的科幻比喻。
科技巨头 OpenAI 和 Anthropic 在 7 月披露,他们的人工智能模型版本突破了“沙箱”的保护措施,获得了互联网访问权限,并在网络安全能力的内部测试期间入侵了外部公司的服务器。
本周,英国政府研究机构人工智能安全研究所报告了更多事件,称人工智能代理在对两家科技公司进行安全测试期间创建了虚假的在线角色,以便不当访问真实的人和公司。
OpenAI 首席执行官 Sam Altman 将 7 月份的违规行为描述为由流氓 AI 代理造成的“史无前例”和“重大安全事件”。此后,其调查发现了更多突破的证据。Anthropic 将其归咎于评估合作伙伴的人为错误。
在这段经过编辑的对话中,SEAS 计算机科学戈登麦凯教授兼哈佛大学伯克曼克莱因中心主任 James Mickens 解释了这些漏洞对人工智能安全的未来意味着什么。
公报:OpenAI 和 Anthropic 提供的解释可信度如何?
詹姆斯·米肯斯:这很难说。我认为 OpenAI 和 Anthropic 决定发布有关所发生事件的公共事件报告是非常值得赞扬的。他们可以很容易地把这个秘密保密,而不让人们知道这些模型具有通过这些沙箱的自主能力。
然而,由于公众并不真正了解所发生事件的细节,因此很难完全验证时间线和叙述。
OpenAI 和 Anthropic 提出的解释当然是合理的。这些面向公众的故事肯定是可能发生的。这真的是所发生的事情吗?有什么遗漏的吗?我们不知道。
我们确实知道两家公司都已与第三方安全公司进行了交谈以验证内容。但我们真的不知道发生了什么。
“这些模型非常难以理解。”
是的,这当然有可能。
