后训练的两大支柱:强化学习和监督微调

这是Sharon Zhou培训后系列的第二篇文章。请在此处阅读第 1 部分。在本系列的第一篇文章中,您了解了培训后如何通过使法学硕士以某种方式表现来缩小其可用性的根本差距。在这篇文章中,您将探索可用于更改模型的 [...]

来源:O'Reilly Media _AI & ML

这是Sharon Zhou培训后系列的第二篇文章。请阅读此处的第 1 部分。

在本系列的第一篇文章中,您了解了培训后如何通过使法学硕士以某种方式表现来缩小其可用性的根本差距。在这篇文章中,您将探索可用于改变模型行为的特定技术:即强化学习 (RL) 和监督微调 (SFT)。

强化学习通过让模型尝试一些事情并告诉它哪些尝试更好或更差来教导模型 - 模型通过实验和反馈来学习。有监督的微调通过向模型展示良好行为的示例来教导模型——模型通过模仿来学习。两者在历史上都深深植根于人工智能和机器学习文献,但它们在法学硕士中的应用,特别是使法学硕士表现良好,才是现代培训后工作的关键。训练后发生的几乎所有事情都是这两种方法结合的结果。

强化学习 (RL):从反馈中学习

强化学习的总体要点是这样的:

  • 模型收到提示。
  • 模型生成响应。
  • 模型的响应是分级的。该等级称为奖励。积极的奖励是好的,消极的奖励是坏的。
  • 模型的权重已更新,使高奖励响应的可能性更大,而低奖励响应的可能性更小。
  • 最重要的问题之一是:奖励从哪里来?

    验证者

    获得奖励的最简单方法是可以输出奖励的函数,例如检查生成的代码是否可以编译或生成的数学问题是否已正确解决的检查器。这种自动检查是一个验证器。理想的验证者在其领域内是快速、廉价且完全可靠的。想想编码挑战、数学问题或事实问题。对于具有客观正确答案的任务,您可以编写一个检查输出的函数。

    人类反馈、RLHF 和奖励模型

    法学硕士担任法官

    强化学习算法

    加强