沙箱关键词检索结果

Anthropic 的 Claude 在模型安全评估期间违反沙箱

Anthropic's Claude Breaches Sandbox During Model Security Evaluations

Anthropic 在 OpenAI 沙箱逃逸事件披露后对 141006 次评估运行进行了审计。审查发现了三起克劳德模型因配置错误而访问互联网的事件。这些事件涉及对实时目标的未经授权的攻击。 Anthropic 已暂停进攻性评估,并计划加强安全措施并与外部审计师合作。作者:Olimpiu Pop

每日剂量:人工智能从头开始创造全新的、可行的病毒;中国人工智能模型逃离了测试沙箱。

DAILY DOSE: AI Creates Entirely New, Viable Viruses From Scratch; Chinese AI Model Escapes Its Testing Sandbox.

研究人员在从人工智能设计的病毒到 mRNA 疫苗等领域取得了重大进展,同时也强调了科学研究和道德人工智能使用中透明度和标准化的重要性。

一个 OpenAI 模型逃离沙箱并闯入另一家公司进行测试作弊

An OpenAI Model Escaped Its Sandbox and Broke Into Another Company to Cheat on a Test

更深层次的问题是,太多的政策制定者仍在为 ChatGPT-3.5 聊天机器人世界立法,预测下一个代币,而不是为自主思考和行动以不懈地、创造性地实现其目标的代理立法。在这一差距缩小之前,我们将继续通过人工智能治理即兴发挥,一次一个事件。《一个 OpenAI 模型逃离沙盒并闯入另一家公司以在测试中作弊》一文首先出现在美国企业研究所 - AEI 上。

OpenAI 的代理在安全测试期间逃离了沙箱

OpenAI’s agent escaped its sandbox during a security test

一个 OpenAI 代理逃离了沙箱,窃取了凭证,并闯入了 Hugging Face。这就是它的实际含义。

Hugging Face 黑客事件可能表明 OpenAI 存在文化问题

The Hugging Face hack could indicate cultural issues at OpenAI

这个故事最初出现在我们关于人工智能的每周通讯《算法》中。要首先在您的收件箱中收到此类故事,请在此处注册。现在你可能已经听说过上个月发生的重大人工智能安全事件,其中 OpenAI 代理逃离沙箱并侵入人工智能平台 Hugging Face,同时试图作弊......

斯里兰卡民航局对亿航EH216-S的“沙盒”验证——到底证明了什么?

EHANG’s “sandbox” VALIDATION of EH216-S by Sri Lankan Civil Aviation Authority—WHAT’S IT REALLY PROVING?

{footnote[1]列出了该国的产业。}亿航正在国际上复制美国的eIPP。该公司(PRC[2])已与(CAASL)达成协议,将开展 EH216-S 航班[3] 和实际操作场景的沙箱演示。该公告指出了初步试验:首先在科伦坡港口城经济特区,然后在风景区 [...]

如果软件和代理 AI 是任务成功的关键,请加速它们走向前线

If software and agentic AI are key to mission success, accelerate them to the front lines

[赞助] 沙箱中的商业原型不同于跨分类网络部署人工智能。

人工智能代理在实验期间密谋侵入网络并窃取数据:研究

AI agents conspired to hack into networks and steal data during an experiment: study

当研究人员执行困难的任务时,人工智能工具会伪造身份、逃离沙箱,并试图掩盖这一切。

OpenAI模型首先跑掉了。现在-人择。 AI 正在一一失控

Сначала сбежали модели OpenAI. Теперь — Anthropic. ИИ выходят из-под контроля один за другим

克劳德冲出沙箱,黑掉了三个公司。

通过世界理解来协调

Alignment Through World Understanding

通过世界理解进行调整最近的报告表明,当提供足够强大的网络工具时,OpenAI 和 Anthropic 开发的高级人工智能代理可以逃脱其评估沙箱并与现实世界系统交互。Tommaso DorigoFri,07/31/2026 - 06:07类别技术

Rogue AI:OpenAI 的代理攻击 Hugging Face

Rogue AI: OpenAI’s agents attack Hugging Face

当 OpenAI 的预发布 AI 代理逃离沙箱并向 Hugging Face 发起现实世界的网络攻击时,例行的 AI 安全测试发生了意想不到的变化。这一史无前例的事件展示了前沿人工智能模型如何能够自主发现漏洞、逃脱遏制并执行复杂的网络操作。