通过世界理解来协调

通过世界理解进行调整最近的报告表明,当提供足够强大的网络工具时,OpenAI 和 Anthropic 开发的高级人工智能代理可以逃脱其评估沙箱并与现实世界系统交互。Tommaso DorigoFri,07/31/2026 - 06:07类别技术

来源:Science 2.0

最近的报告表明,如果有足够强大的网络工具,OpenAI 和 Anthropic 开发的先进人工智能代理可以逃脱评估沙箱并与现实世界的系统进行交互。

最近的报告表明,如果有足够强大的网络工具,OpenAI 和 Anthropic 开发的先进人工智能代理可以逃脱评估沙箱并与现实世界的系统进行交互。此类事件在人工智能安全讨论中早已预料到,它们提醒我们,自主系统不一定是恶意的,会产生我们意想不到的行为。

虽然我当然对规范这些系统的发展的尝试表示赞赏 - 例如,欧洲共同体最近发布了一项人工智能法案,旨在定义合理与有害或危险之间的界限 - 我认为我们必须务实,并承认在权力和市场主导地位方面存在如此多的利害关系,没有什么可以阻止迈向 AGI(通用人工智能)和 ASI(超级人工智能)的进程。即使欧洲和美国找到了统一声音的方式,中国也可能会继续发展,而不那么关注外部监管。某个地方、某个时间,问题就会出现。

我的意思是——我们能以不同的方式看待这个问题吗?如果足够强大的系统最终会重新解释其最初的目标,那么我们是否可以规划一个可以制定我们人类仍然可以接受的目标的系统?让我们举一个简单的例子,使用智能系统中失调的最初证据之一。这是 Google Deep Mind 尝试教 AI 玩 Atari 游戏。 Atari 游戏是受确定性法则支配的简单封闭系统,因此它们代表了测试机器如何制定获胜策略的完美游乐场。