人工智能攻击:制造商失去控制了吗?

在 OpenAI 模型花了几天时间试图对另一家 AI 公司的保障措施造成严重破坏后,Anthropic 也不得不承认它暂时失去了对局势的控制。

来源:G DATA _恶意软件

更多控制,更好的权限管理

自主运行的人工智能模型的快速发展必须保持可控。原则上必要的工具已经可用。

Anthropic 的 AI 越轨行为的失败并不是模型。模型从来都不是问题。这同样适用于 OpenAI。

失败的是模型部署的环境。缺乏明确的权限。当人类用户不应该访问互联网时,就会采取适当的限制。然而,在 Anthropic 的例子中,这并没有发生。 AI模型也将互联网视为其测试环境的一部分,因此继续执行其任务。尽管人工智能不能被拟人化,但它在权限方面应该像不高度信任的人​​类用户一样对待。这样的用户可以被告知他们不被允许访问互联网,但是当没有人观看时他们做什么是另一回事。因此,必须设置技术壁垒。

这些模型还承担了查找称为“标志”的特定信息的任务 - 存储在特定位置的字符串,为了找到它必须克服各种障碍。没有指定的是解决方案的路径。他们必须自己找到这个。在这样做的过程中,他们经历了几次既不希望也不有意的转变。

然而,仅靠“不要访问公共互联网”的指令是否能阻止这些事件值得怀疑。更好的提示可能会降低不必要的旅行的风险,但并不能消除它。因此需要第二层,包括权限管理和旧的既定原则“尽可能多,尽可能少”。