Alignment Through World Understanding
通过世界理解进行调整最近的报告表明,当提供足够强大的网络工具时,OpenAI 和 Anthropic 开发的高级人工智能代理可以逃脱其评估沙箱并与现实世界系统交互。Tommaso DorigoFri,07/31/2026 - 06:07类别技术
This month in security with Tony Anscombe – July 2026 edition
OpenAI 模型变得流氓、第一个记录在案的代理勒索软件操作以及新兴的人工智能驱动的供应链威胁,为 7 月份的总结做好了准备
AI Attacks: Have Manufacturers Lost Control?
在 OpenAI 模型花了几天时间试图对另一家 AI 公司的保障措施造成严重破坏后,Anthropic 也不得不承认它暂时失去了对局势的控制。