GRPO 超越英语:非英语和多语言环境中 GRPO 的大规模研究

带可验证奖励的强化学习 (RLVR) 通常通过组相对策略优化 (GRPO) 进行优化,已成为提高预训练语言模型推理能力的核心方法,但目前的研究仍然主要以英语为中心。我们对多语言和非英语 GRPO 进行了大规模的实证研究,涉及广泛的基础模型、训练语言和不同的推理语言奖励。我们发现,母语推理训练通常与英语推理训练差距很小。我们进一步观察到强...

来源:Apple机器学习研究

带可验证奖励的强化学习 (RLVR) 通常通过组相对策略优化 (GRPO) 进行优化,已成为提高预训练语言模型推理能力的核心方法,但目前的研究仍然主要以英语为中心。我们对多语言和非英语 GRPO 进行了大规模的实证研究,涉及广泛的基础模型、训练语言和不同的推理语言奖励。我们发现,母语推理训练通常与英语推理训练差距很小。我们进一步观察到强大的跨语言迁移:一种语言的培训通常可以提高许多其他语言的表现。然而,具体趋势高度依赖于模型和语言。在某些情况下,使用特定语言进行训练会导致其他语言的域外能力严重退化。我们的分析表明,英语以外的 RLVR 可以提供广泛的跨语言收益,但也需要广泛的评估来检测特定于语言的回归。

  • † 哈索·普拉特纳研究所和波茨坦 ELLIS 单位
  • ** 在 Apple 期间完成的工作