教导法学硕士更新信念,实现高效的长期互动

ABBEL 与传统递归摘要相比的概述。信念取代了完整的交互历史作为代理的工作环境,信念分级通过监督每个信念状态的内容来提高性能。随着任务范围的增长,LLM 环境无法永远扩展。自总结可以实现简洁、可解释的上下文,但会带来显着的性能成本,特别是对于高质量数据稀缺的人工辅助领域,例如协作代码生成。我们用 ABBEL 来解决这个问题:一个框架,以自然语言信念状态的形式隔离和监督摘要的信息内容。动机:递归摘要的成本对于语言模型来说,要有效地协助日益复杂的任务,例如软件开发,它们必须能够与我们进行数百甚至数千个步骤的交互。对于如此长的任务,将整个交互的历史记录保存在上下文中是不切实际的。迄今为止使用的启发式方法是摘要生成,有时称为上下文压缩。例如,Cursor 的最新模型 Composer 2.5 在训练期间使用压缩来提高性能(Cassano 等人,2026)。与作曲家一样,Grandcode(DeepReinforce 等人,2026)是第一个在在线编码竞赛中持续击败所有人类竞争对手的系统,尽管使用了最新的高效注意力模型之一(Qwen 3.5-397B)1,但仍然发现有必要采用上下文摘要。但是

来源:BAIR

ABBEL 与传统递归摘要相比的概述。信念取代了完整的交互历史作为代理的工作环境,并且信念分级通过以下方式提高了性能

监督每个信念状态的内容..

随着任务范围的扩大,LLM 环境不可能永远扩展。自总结可以实现简洁、可解释的上下文,但会带来显着的性能成本,特别是对于高质量数据稀缺的人工辅助领域,例如协作代码生成。我们用 ABBEL 来解决这个问题:一个框架,以自然语言信念状态的形式隔离和监督摘要的信息内容。

动机:递归总结的成本

为了让语言模型有效地协助完成日益复杂的任务(例如软件开发),它们必须能够与我们进行数百甚至数千个步骤的交互。对于如此长的任务,将整个交互的历史记录保存在上下文中是不切实际的。迄今为止使用的启发式方法是摘要生成,有时称为上下文压缩。例如,Cursor 的最新模型 Composer 2.5 在训练期间使用压缩来提高性能(Cassano 等人,2026)。除了 Composer 之外,Grandcode(DeepReinforce 等人,2026)是第一个在在线编码竞赛中持续击败所有人类竞争对手的系统,尽管使用了最新的高效注意力模型之一(Qwen 3.5-397B),但仍然发现有必要采用上下文摘要。

但是压缩有一个问题。尽管基准测试中的性能差距看似较低,但像 Cursor 这样的模型服务器仍然建议用户避免在任务中使用编码助手进行压缩(Heule 等人,2026)。

图 1:通过 RL 微调在组合锁上猜测目标单词的平均尝试次数(越低越好)。情境总结策略会随着培训而改进,但并不能缩小与全情境策略的差距。

ABBEL:突破信念瓶颈采取行动

1 / 16

信念分级

和,