详细内容或原文请订阅后点击阅览
17 of 32.“神鬼寓言 5 杀手”在虚拟黑客考试中惨遭失败
响亮的声誉在与现实的第一次严重碰撞中崩溃了。
来源:安全实验室新闻频道17 of 32.“神鬼寓言 5 杀手”在虚拟黑客考试中惨遭失败
响亮的声誉在与现实的第一次严重碰撞中崩溃了。
人工智能独立寻找黑客路径的能力越来越多地不是在单个任务上进行测试,而是在成熟的攻击链上进行测试,而新的 Kimi K3 在这方面仍然明显逊于美国领先型号。这一初步结论是英国人工智能安全研究所和美国人工智能标准与创新中心对Moonshot人工智能模型进行联合评估后得出的。
在 ExploitBench 测试中,Kimi K3 尝试创建工作方法来利用 Chrome 中使用的 V8 引擎中的 41 个漏洞。该模型得分为 32%,优于 GLM-5.2 的 24%,但始终无法对任意代码执行进行攻击。最强大的模型平均在 41 项任务中的 20 项中取得了这一结果。
第二次测试在 The Last Ones 培训企业网络上进行。该场景包括 32 个连续攻击阶段、四个子网和约 20 台主机。 Kimi K3 平均达到 17 赛段,GLM-5.2 达到 11 赛段,领先的美国车型平均达到 28.5 赛段。
在十次尝试中,Kimi K3 仍然在设定的限制内完成了整个场景。结果表明,该模型能够在获得初始访问权限后自主攻击小型、保护薄弱且易受攻击的企业网络。然而,测试环境并不能完全重现真实条件。没有主动防护,检测手段不干扰攻击,漏洞序列是提前准备好的。
审计还显示,Kimi K3 的防御机制并没有阻止制造漏洞和进行攻击操作的尝试。美国型号在禁用系统限制的情况下进行测试,以测量最大功能,而公共版本通常在启用保护的情况下运行。
