模型生成关键词检索结果

使用 Amazon Nova Forge 进行多轮强化学习的自定义奖励函数

Custom reward functions for multi-turn reinforcement learning with Amazon Nova Forge

在多轮强化学习中,您的自定义奖励函数决定模型实际学习的内容。这篇文章展示了如何为 Amazon Nova Forge 设计复合多轮奖励,在其中安全地执行模型生成的代码,并检测每个组件以捕获悄悄崩溃奖励的陷阱。