针对一个模型的 95.95%:Microsoft 和 Wiz 证明一组神经网络更擅长发现漏洞

在 CyberGym 测试中,神经网络束的性能优于单个模型,并有助于降低代码分析的成本。

来源:安全实验室新闻频道

针对一个模型的 95.95%:Microsoft 和 Wiz 证明一组神经网络更擅长发现漏洞

在 CyberGym 测试中,神经网络束的性能优于单个模型,并有助于降低代码分析的成本。

一个神经网络可以更好地理解复杂的开发链,另一个神经网络可以更准确地对发现进行排序,而更强大的模型可以连接到最困难的任务。微软和谷歌旗下的 Wiz 也得出了类似的结论:在分析程序代码时,多种模型的组合比单一通用人工智能的工作效率更高。

Wiz 报告称,Project Atlas 代理在 CyberGym 测试中得分为 90.9%,击败了 Anthropic Mythos Preview 和 OpenAI GPT-5.5 Cyber。该系统还在广泛使用的开源项目中发现了 200 多个以前未知的零日漏洞。

微软为 MDASH 平台提供了更好的结果。该多模型系统在 Cyber​​Gym 中得分为 95.95%,击败了 Anthropic、Google 和 OpenAI 的解决方案。该测试检查人工智能如何成功地发现程序代码中的真正漏洞并重现利用条件。

相比之下,GPT-5.5 Cyber 得分为 85.6%,GPT-5.6 Sol 得分为 83.6%,Mythos 5 在 83.8% 的作业中重现了目标漏洞,CodeMender 中的 Gemini 3.5 Flash Cyber 的结果为 83.2%。

开发人员将 Atlas 和 MDASH 的主要优势与模型之间分析阶段的分布联系起来。该平台并没有试图让一个神经网络同样好地解决所有问题,而是为研究的每个阶段选择最合适的工具。

Atlas 目前使用 Claude Opus 4.6 和 GPT-5.5。 Wiz 还在与 Google DeepMind 联合项目创建 Gemini Flash Cyber​​ 后,致力于添加 Gemini。该公司预计,扩大模型集将能够更准确地为特定操作选择神经网络。