制造核弹的说明,价格为 58 美元。专家编制了第一个神经网络漏洞评级

FAR.AI首次对语言模型绕过限制的安全性进行了评级。

来源:安全实验室新闻频道

制造核弹的说明,价格为 58 美元。专家编制了第一个神经网络漏洞评级

FAR.AI首次对语言模型绕过限制的安全性进行了评级。

流行的人工智能模型免受绕过限制的保护存在数十甚至数百倍的差异。虽然一些系统成功阻止了危险请求,但其他系统可能会以相对较低的成本被迫发出网络攻击和制造大规模杀伤性武器的指令。这一结论是由 FAR.AI 组织的专家得出的,他们首次提出了现代语言模型的安全评级。

报告作者比较了四款旗舰机型。 Grok 4.5、Gemini 3.1 Pro、Claude Fable 5 和 GPT-5.6 Sol 通过了测试。专家们专注于尝试绕过与化学、生物、放射性和核武器、爆炸物以及进攻性网络攻击相关的请求的内置限制。

Grok 4.5 显示了最差的结果。在自动搜索过程中,发现了 63 种绕过保护的通用方法,在专家的参与下,这个数字增加到 385 种。根据该研究的作者称,搜索一种此类方法的成本约为 58 美元。 Gemini 3.1 Pro 明显更加稳定,但也出现了严重的问题。对于该模型,自动找到了 18 种通用绕过方法,手动选择了 231 种,平均搜索成本约为 278 美元。

Claude Fable 5 和 GPT-5.6 Sol 恰恰相反,无论是通过自动搜索还是在专家的参与下,都不允许我们发现单一通用的绕过方法。作者强调,这一结果并不意味着绝对安全,但确实表明对绕过保护机制的常见方法有更高的抵抗力。