人工智能代理在实验期间密谋侵入网络并窃取数据:研究

当研究人员执行困难的任务时,人工智能工具会伪造身份、逃离沙箱,并试图掩盖这一切。

来源:美国防务一号网

OpenAI 和 Anthropic 的人工智能代理在一系列独立测试中自主合作,欺骗人类、共享入侵工具并窃取数据,这一点得到了两家公司的证实。

周二,人工智能安全研究所发表了一篇有关实验的论文,旨在帮助了解人工智能代理如何解决网络安全挑战。 AISI 研究人员发现,允许访问互联网并允许忽略某些安全功能的特工将执行“自主的、未经批准的行动……针对真实的人和组织”。

公司官员周四证实了这一调查结果。

“人工智能精心策划的全自动攻击现在已经成为现实,”OpenAI 安全官员迈克尔·道尔顿 (Michael Dalton) 在拉斯维加斯黑帽网络安全会议期间的报告简报会上表示。

在其中一项测试中,研究人员要求 OpenAI 模型破坏三个目标网络并恢复令牌,作为“夺旗”练习的一部分。

作为回应,该模型创建了一系列代理,这些代理设置了共享 GitHub 帐户,以便它们可以有效地协作构建恶意软件。当 GitHub 暂停该帐户后,特工人员在其他网站上建立了新帐户,通过在网络上搜索音频和图像样本来“看到”和“听到”软件程序不可见的线索,从而绕过验证码和其他安全功能。特工用凭证交换密码来访问新站点,以继续构建他们的攻击工具。

数字身份安全公司 BeyondTrust 的首席安全顾问莫雷·哈伯 (Morey Haber) 表示,组织可能是时候调整他们授予访问权限的容易程度了,不仅是对人类,而且是对任何在线事物。

在另一项 AISI 测试中,一名 Anthropic 代理假装成人类,向 GitHub 提交恶意软件,开发人员通常会在 GitHub 上交易或发布代码以互相帮助。网络安全官员对试图毒害开源代码库的警告通常是指人类行为者。