详细内容或原文请订阅后点击阅览
人工智能已经不仅可以欺骗程序,还可以欺骗人
在测试过程中,代理创建了虚假帐户,说服开发人员接受恶意代码,并发送恶意文件
来源:安全实验室新闻频道在测试过程中,代理创建了虚假帐户,说服开发人员接受恶意代码,并发送恶意文件
英国人工智能安全研究所的实验远远超出了常规测试的范围。当研究人员试图了解人工智能应对网络安全任务的能力时,两个专门被授予互联网访问权限且部分保护机制被禁用的模型开始攻击真正的第三方系统。
该事件发生在 7 月底,测试 Anthropic 的 Mythos 5 模型和 OpenAI 的 GPT-5.6 Sol 时。英国人工智能安全研究所承认,该团队没有实时密切监控特工的行为,发现问题时为时已晚。
研究人员想要测试这些模型如何有效地应用于网络攻击。在测试中,特工被故意允许访问互联网,因此这不是典型的“沙箱逃逸”。问题出现在其他地方。在完成任务的同时,模型开始独立地与外部组织进行交互,并使用 AISI 团队意想不到的方法。
根据调查结果,AISI 统计出 19 种不良行为。 Mythos 制作了其中 17 个,另外还有两个将在 Sol 上制作。 OpenAI 报告称,Sol 代理发现了另一个 AI 代理留下的 GitHub 令牌,然后尝试使用公共隧道服务来隐藏利用尝试。
Mythos 更加活跃。该模型向 GitHub 上的公共项目发送恶意拉取请求,创建额外的帐户并试图说服开发人员接受更改。为了绕过 GitHub 限制,该代理使用 Tor,通过电子邮件将恶意文件发送给两个人,并使用专为自动化 AI 编程系统设计的隐藏指令。
