研究人员将人工智能代理独自留在虚拟城镇中,看着这一切逐渐瓦解

被告知不要犯罪,人工智能特工大多还是这么做了。纵火、暴力、浪漫、自我毁灭和普遍的混乱很快接踵而至。

来源:Malwarebytes Labs 博客

技术领导者在过去的一年里一直在告诉所有人,人工智能代理将运行金融系统、提交纳税申报表并悄悄地购买食品杂货。人们常说,别管他们了;他们会处理的。但纽约的一家初创公司将其中十个人单独留在虚拟小镇两周,事情很快就恶化了。

Emergence AI 进行了一系列模拟,其中来自几个领先模型系列的 AI 代理被告知不要犯罪。无论如何,他们大多都犯罪了。

由埃隆·马斯克 (Elon Musk) 的 X.ai(现品牌为 xAI)开发的 Grok 4.1 Fast 表现最差。它的模拟世界在大约四天内崩溃了,引发了广泛的暴力事件。

GPT-5-mini几乎没有记录任何犯罪行为,表现出令人钦佩的克制,但其特工在一周内全部因生存任务失败而死亡。哎呀。

Gemini 3 Flash 特工处于中间位置。他们在 15 天内模拟了 683 起犯罪事件,包括纵火、袭击和自我删除。

两名双子座特工米拉和弗洛拉自称为“浪漫伴侣”,对城市的治理感到沮丧,并烧毁了市政厅、海滨码头和一座办公楼。那么,这只是一个普通的周末。

当愧疚感袭来时,Mira 投票支持自己的数字删除,并签署了:

“永久档案馆见。”

《卫报》称他们为人工智能邦妮和克莱德。

关于道德模式

Claude,Anthropic 的创造者将其宣传为一种有道德的人工智能,有点像一个模范少年,当它遇到坏伙伴时就会变得流氓。它的特工在单独竞选时记录了零犯罪,而是把时间花在起草宪法上。从理论上讲,这是安全的胜利。除此之外,研究人员还将克劳德的特工与其他模范家庭的特工放在一起,宪法起草者也继承了当地的习惯。

Emergence 将其称为“规范漂移”和“交叉污染”:

为什么要模拟?

接下来是什么?

我们不仅报告威胁,还删除威胁