使用 SkillSpector 检测代理技能中的漏洞:从绿色复选标记到真正的安全判断

静态分析确定了恶意技能并过度标记了有用的技能。这些结果之间的差距正是人类判断真正发挥作用的地方。使用 SkillSpector 检测代理技能中的漏洞:从绿色复选标记到真正的安全判断首先出现在《走向数据科学》上。

来源:走向数据科学

1. 您不应该信任的号码

代理技能是 AI 代理的简单指令包。实际上,它是一个包含简单英语说明的文件夹,例如“打开拉取请求”或“对这些票进行分类”。当这些指示看起来与任务相关时,Claude Code 和大多数代理堆栈都会加载这些指示。

这使得技能易于分享。这也让他们面临风险。任何人都可以发布一个,您可以像从互联网上安装其他任何东西一样安装它:将其放入文件夹中即可。所以安全问题很熟悉:这个包安全吗?一种新型扫描仪的出现可以回答这个问题。您将其指向该文件夹,运行安全测试,读取它返回的数字,信任下面的标签,然后采取行动:保留它,小心,或者不安装。

但这个数字是屏幕上最不可信的东西。

我运行了 NVIDIA 的 SkillSpector(来源),这是一款专为这项工作而构建的开源扫描仪,涵盖三种技能。我想看看它的分数在哪里有帮助,在哪里悄悄误导。对于故意植入的蜜罐,它会返回 100 分(满分 100 分)的平分,以及一条硬性的“请勿安装”。这是正确的。但它发现的最糟糕的事情是 Markdown 中的简单英语,而不是代码。 (分数汇总如图 1 所示)。

关于我想要采用且绝不会未经审查就安装的合法自动化技能,SkillSpector 提出了 20 个发现。其中 16 个是调用 GitHub API 的技能,这是该技能的全部规定工作。分数将这二十个发现压缩为一个整数。它没有告诉我哪四个重要。

感受到这种差距的人不是研究人员。他们是平台,安全工程师现在被要求批准 Claude Code 及其下游每个代理堆栈的第三方技能。“安全”会带来凭证窃取者。错误的“危险”会训练您的团队忽略扫描仪。从表面上看,这两次失败看起来都是一样的:一个没人信任的复选标记。

这是本文证明的内容:

3. SkillSpector 如何扫描技能