详细内容或原文请订阅后点击阅览
前沿模型如何构建,请阅读 Kimi K3 报告
一个开放的 2.8 万亿参数模型,附带 47 页自己的配方。阅读它会告诉您构建前沿模型现在涉及什么,以及模型的内容有多少。如何构建前沿模型(阅读 Kimi K3 报告)一文首先出现在《走向数据科学》上。
来源:走向数据科学及其系统卡。让它变得更好的决定留在内部:它是如何训练的,它的强化学习遇到了什么,他们如何以足够便宜的价格提供服务。这是前沿实验室的正常处理方式,大多数关于这些系统的外部写作都必须仅从输出开始。
Kimi K3 是值得一读的例外。它是开放的,在大多数基准测试中都接近最好的封闭模型,Moonshot 发布了一份 47 份技术报告,详细介绍了其他实验室保密的部分。我读了一个下午。让我印象深刻的是模型本身在工作中所占的份额是多么小。
前面有一个警告。以下所有具体内容均属于 Moonshot 的内容。我假设封闭实验室做了自己版本的相同类别的工作,但我是从外部推断的,所以请阅读更广泛的“这就是前沿的样子”的说法作为猜测。
架构是一堆小改动
架构是显而易见的起点,并且它的惊喜最少。 K3 是一个包含 2.8 万亿参数的专家混合模型,它比上一个 Kimi 的优势在于将三个相当普通的工程更改叠加在一起。
注意力保持固定大小的运行状态,而不是随着输入而增长的缓存,这使得百万代币上下文变得负担得起;大多数层都使用那个便宜的版本,并且四分之一的层都进行充分的关注。位置没有明确编码,因此循环必须携带它们,这使得模型可以扩展到一百万个令牌,而无需通常的重新缩放黑客。每一层还可以回顾其下面的每一层,而不仅仅是直接下面的一层,因此早期信号不会在上升过程中消失。每个代币都被路由到 896 名专家中的 16 名,比以前稀疏,这需要非常小心才能保持稳定。
简单英语的三个变化
一旦你放弃了符号,这三者中的每一个都很容易记住,而简单的版本就是直觉所在。
