在 Q、K 和 V 之前:重构 Transformer

许多 Transformer 解释者都是从完成的架构开始的。我们问为什么它看起来像这样。《Q、K 和 V 之前:重构 Transformer》一文首先出现在《走向数据科学》上。

来源:走向数据科学

键、查询、值和点积注意力?

“你需要密钥和查询来使令牌相互通信,”流行的互联网类比说。但为什么?关于它们的工作原理有很多很好的类比,但关于我们为什么真正需要它们的材料却少得多。有没有其他选择,或者这些抽象概念是不可避免的吗?

鉴于 Transformer 架构在 2026 年取得了巨大成功,这似乎是一个愚蠢的问题。但如果历史有任何迹象的话,Transformer 最终将被更好的东西所取代。我们越了解它们为何有效,我们就能越快超越它们。

令人难以置信的是,我们可以证明变形金刚的一般形状是难以避免的!从一些关键的设计压力开始,矩阵的字母汤开始看起来不那么随意了。不依赖任何“令牌问问题”的类比,我们将看到查询源于对称问题,而当我们用一小组可重用的转换替换笨重的动态权重矩阵时,就会出现值和注意力头。

当我们将我们的玩具模型与原始(自回归)Transformer 相协调时,我们将以最后一个令人着迷的联系结束:MLP(经常被忽视的前馈块)可以被视为它自己的键值存储。

准备好为我们自己发明 Transformer 了吗?首先,我们需要回到 2014 年,问问为什么循环神经网络还不够。

为什么固定内存失败

标准循环神经网络 (RNN) 存在许多问题。Hochreiter 和 Schmidhuber [1] 非常流行的 LSTM(长短期记忆网络)解决了一些问题,例如“梯度消失”问题,这是 RNN 的更高级版本。但对于所有类型来说,仍然存在一个核心问题:RNN 将过去的输入“压缩”到固定内存中。

让我们用一个粗略的比喻来说明为什么这个“固定内存”是一个问题。假设您将句子“我有五美元”编码到 RNN 的内存中,我们将用下面的灰色矩形表示:

参考文献