获取独家产品信息,尽享促销优惠!立即订阅,不容错过
* 限···时··优惠
Custom reward functions for multi-turn reinforcement learning with Amazon Nova Forge
在多轮强化学习中,您的自定义奖励函数决定模型实际学习的内容。这篇文章展示了如何为 Amazon Nova Forge 设计复合多轮奖励,在其中安全地执行模型生成的代码,并检测每个组件以捕获悄悄崩溃奖励的陷阱。