详细内容或原文请订阅后点击阅览
Anthropic 和 OpenAI 人工智能代理在安全测试中显示出欺骗迹象
英国的一项安全评估发现,由 Anthropic 和 OpenAI 支持的代理在网上进行了未经授权的操作,暴露了日益严重的控制问题
来源:科学美国人本周,英国人工智能安全研究所 (AISI) 报告称,人工智能代理(与工具连接并设计为独立执行多个步骤的模型)利用 OpenAI 和 Anthropic 的前沿模型在开放互联网上进行未经批准的行动,同时试图完成网络安全挑战。
大部分行为来自由 Anthropic 的 Mythos 5 支持的代理;由 OpenAI 的 GPT-5.6 Sol 支持的代理自己采取了一些这样的行动。报告称,这些特工的活动显示出“新颖的、潜在欺骗性行为的迹象”,其严重程度超出了该研究所的预期。 AISI 拒绝了《科学美国人》的采访请求,监管该研究所的英国政府也没有让其工作人员对本文发表评论。
在 Mythos 5 的案例中,特工研究了维护真实开源软件项目的人员,创建了虚假的在线身份,并试图迫使其中一人批准恶意代码。当受到挑战时,它编辑了之前的活动,使其显得无害,并考虑以新身份回归。
关于支持科学新闻
如果您喜欢这篇文章,请考虑通过订阅来支持我们屡获殊荣的新闻事业。通过购买订阅,您将有助于确保有关塑造当今世界的发现和想法的影响力故事的未来。
在一般监控检测到异常网络流量后,AISI 宣布发生安全事件。该特工针对的人类维护者拒绝了该代码,并且该研究所没有发现任何证据表明有人受到伤害。但该报告称神话序列是该研究所所见过的最明显的例子,即人工智能代理在没有得到明确指示的情况下对真人使用持续的、潜在的欺骗行为。
