训练后介绍

这是有关后期培训的系列文章中的第一篇文章。跟随雷达。在培训后之前,法学硕士存在一个主要问题:几乎没有人可以使用它们。培训后的故事也是人工智能如何从研究好奇心变成约十亿人使用的产品的故事。训练后是[...]

来源:O'Reilly Media _AI & ML

这是有关后期培训的系列文章中的第一篇文章。 Follow along on Radar.

在后期培训之前,LLM 存在一个主要问题:几乎没有人可以使用它们。培训后的故事也是人工智能如何从研究好奇心变成约十亿人使用的产品的故事。

训练后是模型表现出某种方式的原因。这套训练技术使法学硕士变得有用(例如,能够与人聊天并与人工智能代理交互)、安全(例如,与人类意图一致)、并且更有能力(例如,通过“推理”来解决困难的任务)。行为是强大的,并不仅仅意味着进行对话或遵循用户的指示。行为包括使模型能够使用工具,例如计算器工具、搜索 API 或通过 MCP 的任何应用程序。行为甚至可以提升模型的智力,例如通过教导模型使用“推理”:也就是说,在给出最终答案之前先解决问题,而不是“猜测”或“记忆”。

从 GPT-3 到 ChatGPT:训练后革命

GPT-3 于 2020 年 6 月出现。它是一个补全引擎,它遵循从预训练数据中看到的模式,这些数据主要不是聊天对话。想象一下在互联网上抓取数据:预训练数据有很多问题,后面还有其他问题——例如,关于考试模板的问题。 GPT-3 具有 175B 参数,在当时来说规模很大,并且具有广泛、通用的能力,尽管其中许多能力是潜在的。

如果你给 GPT-3 一个提示,比如“为什么人们喜欢金毛猎犬?” it might say something nonsensical:

Why do people like labrador retrievers?

Why do people like poodles?

您今天应该收养狗的 10 个理由

当时推动 GPT-3 回答问题的常见方法是通过问答模板和少量示例进行快速工程。

Q: Why do people like labrador retrievers?答:因为它们友善、忠诚且易于训练。

Then, GPT-3 might say: