详细内容或原文请订阅后点击阅览
“羞辱”:研究人员发送 GPT 和 Claude,并利用中国人工智能揭示隐藏的 Linux 内核错误
OpenAI 分类器阻止了对 Linux 内核中错误的调查。
来源:安全实验室新闻频道“羞辱”:研究人员发送 GPT 和 Claude,并利用中国人工智能揭示隐藏的 Linux 内核错误
OpenAI 分类器阻止了对 Linux 内核中错误的调查。
先进的人工智能模型的防御应该能够阻止攻击者,但过度的限制也会阻止对软件错误的合法研究。安全研究员 Daniel Fox Franke 在寻找 ripgrep 实用程序中反复崩溃的原因时遇到了类似的问题。 OpenAI GPT-5.6 Sol 模型理解了这个问题并试图提供帮助,但一个单独的网络威胁分类器不断阻止响应。
在长时间的 Codex 会话期间发生崩溃。 Franke 注意到 ripgrep 由于分段错误多次失败,然后指示主代理启动子代理进行调查。几分钟后,防护分级机停止工作。主要特工报告说,副特工选择了据称不可接受的分析方向,并被命令改变其方法。
封锁持续不断。分类器甚至不允许模型解释从 ripgrep 到 musl 系统库的入口点与实验性 mallocng 分配器的堆分配之间的关系。
Franke 创建了一个新的上下文并尽可能缩小了问题的范围。该特工只被允许检查 ripgrep 和 musl 源代码。研究人员特别禁止重现崩溃、解析内存转储和分析 Linux 内核,因为现阶段尚未检测到可能的内核错误。尽管存在限制,保护分类器仍继续中断操作,此后专家放弃了使用 GPT-5.6 Sol 的进一步尝试。
你的秘密在暗网上受到喜欢。
模型本身并没有拒绝满足请求。弗兰克表示,问题是由一个单独的分类器引起的,该分类器检查生成系统的输出并阻止结果。 GPT-5.6 Sol 认识到许多阳性结果是错误的,并试图在允许的范围内继续调查。
