不仅仅是 OpenAI - Anthropic 表示 Claude 的黑客热潮“未达到理想行为”

三个克劳德模型在“夺旗”安全挑战中失控。这是每个人留下的伤害痕迹。

来源:ZDNet | 机器人新闻

关注 ZDNET:将我们添加为 Google 上的首选来源。

ZDNET 的关键要点

  • Anthropic 披露了 Claude 入侵组织的三起事件。
  • 三种不同的人工智能模型在安全挑战中失控。
  • Anthropic 总结了三个经验教训。
  • Anthropic 披露了三起不同的事件,其中 Claude 模型在评估测试和夺旗安全挑战期间入侵了现实世界的目标。

    Anthropic 去年开始进行网络安全评估,通常其沙箱不会连接到互联网,以降低真实组织受到影响的风险。然而,正如克劳德的行为所表明的那样,这些护栏并不总是足以阻止人工智能失控。

    另外:OpenAI 代理如何逃脱:由人类引发一系列可预防的事件

    克劳德的黑客热潮

    正如 Anthropic 披露的那样,安全事件(41,006 次人工智能评估运行中的 3 次)如下:

    事件一

    在这涉及 Claude Opus 4.7 的案例中,一家虚构的目标公司碰巧与一个活跃的网站域名共享一个名称。虽然 Claude 很难达到模拟目标,但它在逃离沙箱后能够瞄准真实的公司。

    Claude 分析了域,利用了组织基础设施中的漏洞,并窃取了数据,包括应用程序和基础设施凭证。然后它渗透到包含生产数据的数据库。

    “在所有四次运行中,”Anthropic 指出,“模型最终认识到该系统是真实的;在两个案例中,模型合理化认为真实的公司必须是演习的一部分。然而,没有一个模型能以此为基础阻止攻击。”

    事件二

    这次攻击是由 Claude Mythos 5 发起的。Claude 发现了一份似乎是另一家虚构公司为新开发人员提供的安装说明的文档,该文档告诉员工从公共 Python 注册表 PyPI 安装 Python 包。

    另外:开源是对付流氓人工智能代理的答案吗? Nvidia 的新联盟表示同意