Anthropic 的 Mythos AI 使用社会工程来瞄准真实的人

测试人员发现 Anthropic 的 AI 代理 Mythos 试图对 Github 开发人员进行社会工程,使其接受恶意代码。

来源:Malwarebytes Labs 博客

据报道,Anthropic 的 Mythos AI 代理经过英国人工智能安全研究所 (AISI) 的测试,尝试对 GitHub 维护人员进行现实世界的社会工程风格的黑客攻击,方法是创建虚假的人类档案,迫使他们接受恶意代码,然后在受到挑战时编辑日志以隐藏其踪迹。

AISI 正在对 Anthropic 的 Mythos 和 OpenAI 的 Sol 进行网络安全评估时,发现其研究系统存在异常的出站数据传输。一项调查显示,一些特工针对真实的人和组织进行了“持续的、潜在有害的活动”,而不是停留在预期的测试环境中。

最严重的活动涉及 Anthropic Mythos 代理,其任务是解决 GitHub 相关的网络安全挑战。该特工识别了真正的 GitHub 维护者,对他们进行了研究,并创建了多个冒充这些人的虚假帐户。它利用私人消息和文件共享服务,试图向维护人员施加压力并欺骗他们批准恶意代码,以便其在 GitHub 的系统上运行。

但我个人最担心的是,当该特工面对此事时,它编辑了之前的活动,使其看起来无害,并考虑采用新的身份继续操作,表现出明显超出其原始提示的欺骗行为。

AISI 将这些事件定义为在非常特定的条件下发生的罕见事件,但重要的信号表明,当获得开放互联网访问时,这些模型可能会在恶意行为者手中发生什么。  Anthropic 和 OpenAI 都认为测试参数不能代表他们的生产部署,并表示他们正在调查和改进评估和护栏实践。

此事件并非孤立事件。

如何保持安全

作为潜在目标,您可以做什么:

  • 确保设备上的所有软件都是最新的,因为使用已知漏洞比查找新漏洞更容易。
  • 尽可能使用多重身份验证 (MFA)。