GRPO Beyond English: A Large-Scale Study of GRPO in Non-English and Multilingual Settings
带可验证奖励的强化学习 (RLVR) 通常通过组相对策略优化 (GRPO) 进行优化,已成为提高预训练语言模型推理能力的核心方法,但目前的研究仍然主要以英语为中心。我们对多语言和非英语 GRPO 进行了大规模的实证研究,涉及广泛的基础模型、训练语言和不同的推理语言奖励。我们发现,母语推理训练通常与英语推理训练差距很小。我们进一步观察到强...
Build a Reasoning LLM from Scratch: A Complete Guide to GRPO, RoPE & Pretraining.
使用 GRPO、RoPE 和现代变压器构建推理法学硕士。帖子从头开始构建推理法学硕士:GRPO、RoPE 和预训练的完整指南。首先出现在Spritle软件上。