Pre-training isn’t bitter enough
理查德·萨顿 (Richard Sutton) 的“惨痛教训”通常被解读为对人工智能系统构建过多人类知识的警告。从长远来看,获胜的方法不是那些最直接编码我们聪明直觉的方法,而是那些可扩展的方法:搜索、学习和其他可以吸收更多计算和数据的通用方法。乍一看,现代基础模型预训练看起来就像是该课程的胜利。我们采用通用架构,将其暴露给海量数据,并以简单的自我监督目标对其进行训练。语言模型预测下一个标记。视觉模型重建遮罩斑块、对齐视图或匹配教师表示。该配方简单且可扩展。但有一个问题。预训练可能会遵循“痛苦的教训”来训练模型,但不会选择模型应该训练的内容。目标仍然是在训练循环之外选择的。我们进行大规模的预训练