使用 Amazon Nova Forge 进行多轮强化学习的自定义奖励函数

在多轮强化学习中,您的自定义奖励函数决定模型实际学习的内容。这篇文章展示了如何为 Amazon Nova Forge 设计复合多轮奖励,在其中安全地执行模型生成的代码,并检测每个组件以捕获悄悄崩溃奖励的陷阱。

来源:亚马逊云科技 _机器学习

在多轮强化学习 (RL) 中,您的自定义奖励函数决定模型实际学习的内容。当每条训练曲线看起来都很健康时,一个微妙的错误奖励可能会悄悄地传授错误的东西。设计一个能够承受多回合代理任务的奖励是定制 Amazon Nova 模型中最困难的部分之一。对于多轮训练,Amazon Nova Forge 通过其自带的编排 (BYOO) 功能在您自己的环境中运行您的奖励逻辑。您可以专注于定义良好的结果,而 Nova Forge 则协调轮流推出、消息传递和对话状态。 Nova Forge 还提供无服务器多轮 RL 选项,现已普遍可用,适合不喜欢管理该环境的团队。本文使用 BYOO 路径。

Amazon Nova 提供多种定制方法,其中强化微调 (RFT) 尤为突出,因为它可以通过迭代反馈来教导模型您想要的行为。 RFT 采用与监督微调 (SFT) 不同的方法。它不需要带有注释推理路径的精选示例,而是从模型自身输出的评估信号中学习。多轮 RFT 将其扩展到执行一系列步骤的代理,例如调用工具、执行代码或从错误中恢复。它优化整个轨迹的累积奖励,而不是对单个响应进行评分。 RFT 的核心在于奖励函数:指导模型的评分机制以及您设计的部分。

图 1 — 从共享检查点进行平等计算后训练后的分布外 (OOD) 性能。强化学习提高了所有任务变体的 OOD 泛化能力,而 SFT 则降低了性能。改编自 Chu 等人,2025

先决条件

要继续操作,您需要以下内容:

  • Amazon Nova Forge 订阅,提供 Nova 自定义 SDK 和多轮 RFT API。
  • 本系列第 1 部分中的多轮 RFT 基础设施:
  • 奖励评估如何运作