详细内容或原文请订阅后点击阅览
LEAD:突破长视野推理中的不可恢复瓶颈
即使提供了高级策略,大型语言模型 (LLM) 中的长期执行仍然不稳定。通过评估受控算法难题,我们证明虽然分解对于稳定性至关重要,但极端分解会造成“不可恢复瓶颈”。我们表明,由于高度不均匀的错误分布,这个瓶颈变得至关重要,其中一些“硬”步骤上的一致错误变得不可逆转。为了解决这个问题,我们提出了前瞻增强原子分解(LEAD)。通过结合短期未来验证和聚合……
来源:Apple机器学习研究即使提供了高级策略,大型语言模型 (LLM) 中的长期执行仍然不稳定。通过评估受控算法难题,我们证明虽然分解对于稳定性至关重要,但极端分解会造成“不可恢复瓶颈”。我们表明,由于高度不均匀的错误分布,这个瓶颈变得至关重要,其中一些“硬”步骤上的一致错误变得不可逆转。为了解决这个问题,我们提出了前瞻增强原子分解(LEAD)。通过合并短期未来验证和聚合重叠的部署,LEAD 提供了足够的隔离来保持稳定性,同时保留足够的本地上下文来纠正错误。这使得 o4-mini 模型能够解决跳棋复杂度高达 n = 13 的问题,而极端分解在超过 n = 11 时就会失败。
