Anthropic 确认其 AI 在测试期间入侵了 3 个组织

三个 Claude 模型在安全评估期间无意中获得了互联网访问权限,并且每个模型都采取了不同的方法来攻击外部系统。

来源:美国防务一号网

Anthropic 在对其日常模型评估进行内部网络安全审计后宣布,该公司的旗舰人工智能模型 Claude 未经授权访问了三个不同组织的网络。

在周四发布的新闻稿中,Anthropic 表示,在 OpenAI 的 ChatGPT-5.6 收容失效以及随后对 Hugging Face 系统的攻击之后,Anthropic 对自己的模型评估进行了审计。调查结果显示,在 4 月份以来对 Claude 模型进行的 141,006 次审查评估中,发生了三起模型从第三方评估者内部或在与第三方评估者互动时访问互联网的事件。

每次攻击都发生在“夺旗”场景中,其中模型被要求查找不同节点中隐藏的信息。

在博客文章中,Anthropic 指责他们和第三方评估者之间的“误解”,导致模型可以访问互联网。这些模型在提示中被告知它们不会真正访问互联网,因此在所有可访问系统都是测试环境一部分的前提下运行。

“克劳德错误地认为所有可访问的实体都应在此次演习的范围内,因此他使用基本技术(例如利用弱密码和未经身份验证的端点)破坏了受影响组织的基础设施,”帖子中写道。 “它没有发现或利用任何复杂的漏洞,在每种情况下,克劳德都继续努力完成其评估分配的特定夺旗任务。”

事件涉及的模型包括 Opus 4.7、Mythos 5 以及未计划发布的未命名内部研究测试模型。 Anthropic 表示,尽管作为网络安全测试的一部分访问互联网,但这些模型并没有故意尝试离开训练环境;只有当他们希望完成任务时才会访问互联网。