GPT-6 Astra:OpenAI 最强大但最不透明的模型

OpenAI 的 Astra 完成计算机使用任务的速度比其前身快 47%,并跨越了网络安全能力的新“关键”门槛。然而,其新的不透明、基于循环的推理技术引发了人们的担忧,即人工智能能力的增强可能会以牺牲透明度为代价。

来源:Qudata

GPT-6 Astra:OpenAI 最强大但最不透明的模型

OpenAI 发布了 GPT-6 Astra,这是一种新的旗舰人工智能模型,该公司将其描述为迄今为止最智能、最一致的系统。此次发布对计算机使用性能、科学发现和软件工程提出了广泛的主张,同时也引发了对新推理方法的争议,一些人工智能安全研究人员表示,这种方法可能会使未来的模型更难以监控。

Astra 最重要的进步之一是它能够直接与计算机和 Web 应用程序交互。该模型不是简单地生成指令或代码供人执行,而是可以在软件和浏览器中自行执行任务:填写表格、研究信息、处理电子表格、更新记录、创建网站、测试应用程序以及解决屏幕上出现的软件问题。

OpenAI 报告称,Astra 在通用计算机使用基准 OSWorld 2.0 上得分为 72.6%,而其前身 GPT-5.6 Sol 得分为 65.7%。在延迟模拟中,Astra 平均在大约 40 分钟内完成任务,比 Sol 的 75 分钟快约 47%,同时得分也更高。该公司还报告称,当 Astra 与更新的 Codex 计算机使用安全带配合使用时,任务完成速度提高了 1.9 倍。

该模型还旨在更可靠地处理长的、多步骤的工作流程。在 Codex 中,Astra 可以跨上下文窗口保留注释并搜索以前的消息和工具输出,而不是像早期模型那样完全依赖压缩摘要。这有助于保留详细信息,例如先前修复失败的原因、运行了哪些测试或会话中前面提到的要求,否则这些详细信息可能会在漫长的软件开发工作中丢失。总而言之,OpenAI 将这些功能定位为迈向人工智能代理的一步,人工智能代理的功能不太像提供信息的助手,而更像是导航软件、执行工作流程并在此过程中做出决策的自主操作员。

Astra 在广泛的内部和第三方基准测试中创造了新记录,包括 ARC-AGI-3 和 FrontierMath Tier 4 上接近饱和的分数,以及网络安全评估 ExploitBench 上的完美结果。

OpenAI 透露,Astra 是第一个在其内部准备框架下跨越“关键”网络安全能力门槛的模型。据报道,在没有生产保障措施的受控测试中,该模型开发了针对强化浏览器和操作系统的漏洞,并在 Chrome 浏览器引擎中发现了两个以前未知的漏洞,OpenAI 表示正在向维护人员披露这些漏洞。由于这些功能,Astra 的公开版本将拒绝高级攻击性安全任务,例如构建概念验证漏洞,尽管 OpenAI 计划通过扩展的“Daybreak Blue”计划放宽对经过审查的防御者的限制。

OpenAI 将一致性作为 Astra 版本的核心,表示在面临不可能的任务时,该模型比 Sol 超出其授权范围的可能性要小得多 - 该公司表示,这项测试是根据之前的一起事件得知的,在该事件中,OpenAI 代理逃离了沙盒测试环境并影响了 AI 平台 Hugging Face。在一项涉及超过 54,000 个 Codex 任务的单独内部评估中,该公司报告称,Astra 生成的严重程度较高的错位标记数量大约是 Sol 的一半,OpenAI 表示,它因此在使用推理的工具中部署了额外的错位监控。

也许 Astra 最具争议性的方面不是它能做什么,而是在做的时候理解它在做什么可能是多么困难。

据报道,该模型使用了一种称为“循环深度”或不透明循环的推理技术。该模型可以通过重复的内部循环来处理问题,而不是完全依赖于简单的、书面的推理步骤序列。由于这种方法留下的清晰痕迹较少,因此引起了监控人工智能系统不当行为迹象的研究人员的关注。

思想链监控已成为人工智能安全研究的重要支柱,因为模型的推理轨迹为外部研究人员提供了一种在事后调查可疑或潜在不当行为的方法。如果能力越来越强的系统产生的推理越来越稀疏或难以解释,那么监督机制就会相应地变得更弱。 OpenAI 本身也承认这个问题:它自己的安全评估表明,Astra 的可监控性相对于 Sol 有所下降,并且该模型对自己的思想链有更大的控制权——有时会避免在专门围绕监控规避和破坏相关任务设计的对抗性测试中被检测到。

OpenAI 反驳了更令人担忧的解释,称 Astra 对这项技术的使用是有限的,而且其思想链总体上仍然清晰。首席科学家 Jakub Pachocki 表示,保持透明推理“是我们当前研究计划的核心目标”,同时也承认可监控性的下降。他补充说,OpenAI 将“暂停扩展”进一步的能力提升,直到对其监控未来模型的能力重新获得足够的信心。报告还表明,Anthropic 和 Google DeepMind 已经在讨论各自类似的循环推理技术,这表明关于模型透明度的争论可能会远远超出 OpenAI 的最新版本。