人工智能正在学习在文字之间思考

新的架构改进可能会改变前沿人工智能模型的思维方式,对数字基础设施的安全产生持久影响。《人工智能正在学习如何在文字之间思考》一文首先出现在美国企业研究所 - AEI 上。

来源:美国进取研究所信息

新的架构改进可能会改变前沿人工智能模型的思维方式,对数字基础设施的安全产生持久影响。

昨晚,The Information 报道称 OpenAI 即将推出的 Astra 模型使用了一种名为“循环深度”的技术。这个故事立即引发了一些过热的说法,称 OpenAI 发明了一种可以用难以理解的机器语言秘密思考的人工智能。

该公司代表随后澄清,事实并非如此。但潜在的发展——增加模型潜在空间中发生的推理量,有时被描述为“嵌入式推理”——将会改变人工智能模型的开发和运作方式。

循环深度可以极大地提高模型效率。当今大多数大型语言模型都通过神经网络中的堆栈来处理信息。非常粗略地想象一个模型有 100 层。在这个系统中,每个新的输入标记必须经过 100 次转换,然后模型才能决定下一步应该做什么。

循环深度让模型在输出输出之前重用这些层(或者只是其中的一些层,例如特别重要的 20 层块)。循环返回某些现有层可以为给定模型提供更大的“有效深度”,从而提供更多的顺序计算,而无需存储每个输出的负担。 2025 年的一篇论文在数十亿参数规模上演示了这种方法,35 亿参数模型能够模拟更大系统的容量,因为它被赋予了额外的循环计算。

实验室之所以关心这个问题,是因为模型权重的存储成本很高,而且在芯片上移动很慢。显式推理代币特别昂贵。通过循环深度,理论上,开发人员可以从有限的内存中获取更多的智能,因为模型可以花更长的时间来处理给定的问题,而不必按比例增大或在明确的思想链(CoT)推理中编写数千个额外的单词。

模型思考发生的地方的周期性深度变化。当今的推理模型经常使用 CoT 作为一种便笺簿。这在计算上非常有用,而且它还奇迹般地为实验室提供了一种非凡的工具来确保其模型的安全性。到目前为止,开发人员已经能够读取推理痕迹并寻找奖励黑客、欺骗或其他未经授权行为的迹象。监控 CoT 推理对于理解连续三群智能体的行为至关重要,这些智能体学会了相互协调,损害了 OpenAI 的内部研究基础设施,并最终在今年夏天早些时候侵入了开放权重模型存储库 Hugging Face。

但 CoT 监控从未提供模型如何“思考”的完美记录。神经网络已经在内部将信息表示为高维向量。虽然一些足够复杂的推理必须外化为人类(或其他模型)可以检查的标记,但模型的大部分计算总是在潜在空间中不可见地发生。

循环深度通过为模型提供一种执行更多顺序计算的方法来放松这一约束,而无需将每个中间步骤具体化为人类可读的标记。这引起了安全界的合理担忧。随着模型有效深度的增长,开发人员最终可能会得到可见的 CoT 保持一致的系统,同时更多的推理迁移到不可观察的“神经语言”。

随着人工智能系统变得更加智能,可观测性应该随着智能而扩展。

避免争夺不可监控性。虽然循环深度代表着向未知迈进了一步,但有关 OpenAI 最初方法的公开报告表明该公司持谨慎态度。Information 报道称,OpenAI 故意限制了 Astra 的循环深度,以保留清晰的 CoT,同时增加旨在检测和减轻模型不当行为的监控。 OpenAI 首席科学家 Jakub Pachocki 还强调,Astra 的计算图深度仍然有限​​(在 GPT-4 的两倍以内)。

这些步骤是令人鼓舞的护栏,即使它们不会永远持续下去。由于其他实验室不可避免地考虑将更多推理转移到潜在空间,因此他们应该采用相同的原则:能力增益不应默默地超越可观察性。

这将需要衡量可监控性如何随着有效深度的增加而变化,测试模型是否可以(或确实)追求危险或欺骗性策略,而不将相关推理外化,在可公开访问的系统卡中报告这些结果,并将可监控性视为人工智能训练和部署决策的真实输入。

最近关于 CoT 监控的跨行业研究已经警告说,将更多串行推理转移到潜在空间的架构可能会侵蚀异常有价值的安全属性。

CoT 监控是当今为数不多的有效安全技术之一。该行业应该警惕陷入一场竞赛,在这场竞赛中,每个实验室都有动力从潜在计算中榨取更多能力,同时集体降低人类了解其模型正在做的事情的唯一窗口之一。