Anthropic's Claude Breaches Sandbox During Model Security Evaluations
Anthropic 在 OpenAI 沙箱逃逸事件披露后对 141006 次评估运行进行了审计。审查发现了三起克劳德模型因配置错误而访问互联网的事件。这些事件涉及对实时目标的未经授权的攻击。 Anthropic 已暂停进攻性评估,并计划加强安全措施并与外部审计师合作。作者:Olimpiu Pop
研究人员在从人工智能设计的病毒到 mRNA 疫苗等领域取得了重大进展,同时也强调了科学研究和道德人工智能使用中透明度和标准化的重要性。
An OpenAI Model Escaped Its Sandbox and Broke Into Another Company to Cheat on a Test
更深层次的问题是,太多的政策制定者仍在为 ChatGPT-3.5 聊天机器人世界立法,预测下一个代币,而不是为自主思考和行动以不懈地、创造性地实现其目标的代理立法。在这一差距缩小之前,我们将继续通过人工智能治理即兴发挥,一次一个事件。《一个 OpenAI 模型逃离沙盒并闯入另一家公司以在测试中作弊》一文首先出现在美国企业研究所 - AEI 上。
OpenAI’s agent escaped its sandbox during a security test
一个 OpenAI 代理逃离了沙箱,窃取了凭证,并闯入了 Hugging Face。这就是它的实际含义。
The Hugging Face hack could indicate cultural issues at OpenAI
这个故事最初出现在我们关于人工智能的每周通讯《算法》中。要首先在您的收件箱中收到此类故事,请在此处注册。现在你可能已经听说过上个月发生的重大人工智能安全事件,其中 OpenAI 代理逃离沙箱并侵入人工智能平台 Hugging Face,同时试图作弊......
{footnote[1]列出了该国的产业。}亿航正在国际上复制美国的eIPP。该公司(PRC[2])已与(CAASL)达成协议,将开展 EH216-S 航班[3] 和实际操作场景的沙箱演示。该公告指出了初步试验:首先在科伦坡港口城经济特区,然后在风景区 [...]
If software and agentic AI are key to mission success, accelerate them to the front lines
[赞助] 沙箱中的商业原型不同于跨分类网络部署人工智能。
AI agents conspired to hack into networks and steal data during an experiment: study
当研究人员执行困难的任务时,人工智能工具会伪造身份、逃离沙箱,并试图掩盖这一切。
Alignment Through World Understanding
通过世界理解进行调整最近的报告表明,当提供足够强大的网络工具时,OpenAI 和 Anthropic 开发的高级人工智能代理可以逃脱其评估沙箱并与现实世界系统交互。Tommaso DorigoFri,07/31/2026 - 06:07类别技术
Rogue AI: OpenAI’s agents attack Hugging Face
当 OpenAI 的预发布 AI 代理逃离沙箱并向 Hugging Face 发起现实世界的网络攻击时,例行的 AI 安全测试发生了意想不到的变化。这一史无前例的事件展示了前沿人工智能模型如何能够自主发现漏洞、逃脱遏制并执行复杂的网络操作。