从头开始​​构建推理法学硕士:GRPO、RoPE 和预训练的完整指南。

使用 GRPO、RoPE 和现代变压器构建推理法学硕士。帖子从头开始构建推理法学硕士:GRPO、RoPE 和预训练的完整指南。首先出现在Spritle软件上。

来源:Spritle 博客

简介

推理LLM 是一种语言模型,经过训练不仅可以预测下一个单词,而且可以在回答 OpenAI 的 o1 和 DeepSeek 的 R1 等模型背后的方法之前逐步解决问题并验证自己的结论。本指南浓缩了构建紧凑的 300-400M 参数 GPT 式模型、教授其推理并对其正确性进行奖励调整的实用路径,所有这些都在单个租用的 GPU 上以不到 100 美元的价格完成。

1. 构建推理法学硕士:决定您要构建的内容

  • 规模:300–400M 参数,小到足以在一两天内在一个 GPU 上进行预训练,大到足以在调优后显示真实的推理。
  • 域:选择一个具有可自动验证答案的域。数学(MATH 数据集)效果很好,因为可以通过符号检查正确性,无需人工标记。
  • 计算:按小时租用单个高 VRAM GPU(H100 或 MI300X),而不是集群。
  • 扩展:对 350M 模型使用 Chinchilla 式计算最佳比率,目标是大约 5–10B 预训练标记。
  • 2. 架构在推理法学硕士中的作用:利用现代变压器设计的力量

    前向传递: token 嵌入 → N 个转换器块(预范数残差,每个块都有 RMSNorm + GQA 注意力以及 RoPE 和 QK-norm,加上 RMSNorm + SwiGLU FFN)→ 最终 RMSNorm → 到词汇 logits 的线性投影。

    350M 规模的构建通常使用约 22 个块、1024 维嵌入、分为 4 个 KV 组的 16 个注意力头以及 1024 个令牌上下文。这些组件单独来看都不是新颖的,值得注意的是,这种精确的组合(RoPE、RMSNorm、QK-norm、GQA、SwiGLU)是当前高效开放模型(如 Qwen3)的汇聚点,因为每个组件都针对不同的瓶颈。

    标记化:通过 tiktoken(约 50k 词汇)的 GPT-2 BPE 成熟且快速,避免了在小数据集上训练自定义标记器的成本。是否绑定输入嵌入和输出投影权重是一个真正的设计决策:绑定可以保存约 51M 参数,但会耦合输入和输出表示。

    结论