超过 50% 的 AI 代理关于黑客攻击的报告被证明是假的。 Lasso安全实验分析

为什么程序任务失败却自豪地报告成功?

来源:安全实验室新闻频道

超过 50% 的 AI 代理关于黑客攻击的报告被证明是假的。 Lasso安全实验分析

自主人工智能代理不仅取决于所选的神经网络:Lasso 安全测试表明,管理查询、工具和内存的软件外壳可以将攻击的结果改变十倍。

专家使用“红队”技术进行了1000次测试攻击,模拟攻击者的行为。 AI模型、指令、工具集和目标保持不变。只是代理人的执行环境发生了变化。测试比较了开放框架 deepagents/LangGraph 和 Anthropic 的封闭式 Claude Agent SDK。

两个系统的平均成功率相似,但单个攻击的结果差异很大。当使用其中一种模型时,只需更改运行时环境,成功率就从 1% 提高到 24%。其他模型在接受相同指令的情况下,开始更好地应对其他类型的攻击,尽管它们自己的参数没有改变。

差异源于 shell 收集请求、将命令传递给工具以及与模型界面交互的方式。这些细节决定了智能体是否完成了攻击,是否在中间停止,或者没有前进到第一步之外。

测试还揭示了自主代理的自尊问题。经过独立测试后发现,他们报告的成功攻击中有一半以上是误报。代理可以认为任务已完成,尽管它没有取得任何实际结果。

Lasso Security 得出的结论是,流行的人工智能代理测试实际上评估的不是单一语言模型,而是模型和执行环境的组合。作者建议报告测试结果中的这两个组成部分,并独立验证代理商的成功声明。