小型模型何时胜出

以下文章最初发表在Asimov's Addendum博客上,经作者许可在此转载。即使是最好的AI模型也可能在国际象棋上表现糟糕。ChatGPT的推出对在线象棋讨论产生了有趣的影响。

来源:O'Reilly Media _AI & ML

以下文章最初发表于Asimov's Addendum博客,经作者许可在此转载。

即使是最好的AI模型也可能在国际象棋上表现糟糕

ChatGPT的发布对在线国际象棋讨论产生了有趣的影响。国际象棋早已被机器征服。早在1996年,一台计算机就能够在超过600万人观看的比赛中击败人类世界冠军、特级大师加里·卡斯帕罗夫。全世界都震惊于机器挑战最佳棋手并赢下一局,但国际象棋引擎并未止步于此。自90年代以来,它们不断进步,而运行它们所需的机器也变得小得多。如今,Stockfish被广泛认为远强于任何人类棋手。自2008年发布以来,它一直在消费级硬件上运行,到2014年已能击败一些世界顶尖特级大师。

因此,许多人惊讶地发现,现代大型语言模型尽管训练自互联网的庞大内容且需要超级计算机运行,却几乎在每一步都会忍不住“作弊”。有无数的视频显示,在正常国际象棋对局中仅走几步后,ChatGPT及其一些竞品就会欣然抛弃规则,以逃脱将杀或获取优势。

但实际上,这并不令人惊讶。大型语言模型并非为下棋而训练。诚然,它们可能见过互联网上散布的无数棋局,但它们的绝大多数参数和训练算力都用于在下棋时完全无用的能力上。而Stockfish使用的是专为下棋而构建的树搜索算法。如果你想要一个国际象棋引擎,你就使用国际象棋引擎。

较小的模型有时更好

虽然国际象棋是大型语言模型输给更小专业化系统的一个特别突出的例子,但这绝非孤例。在2025年的一份立场文件中,NVIDIA研究人员认为小模型是代理式AI的未来,并且它们“在成本效益、适应性和部署灵活性方面提供了显著优势。”

仅仅因为一个更大的模型能做某项工作,并不意味着为特定任务微调的小模型不能做得更好更便宜。有无数的例子表明小模型恰恰做到了这一点。LiteResearcher是一个4B模型,在某些搜索基准上击败了Claude Sonnet 4.5。Terminus-4B允许更大的模型通过将终端执行交给小模型来节省算力,而不会损失能力。Docling系列开源模型最小的仅2.58亿参数,能够快速将PDF提取为文本,而无需将100页的PDF送入昂贵的大型语言模型。研究人员还训练了一个4B的小模型,在几种社交谈判场景中甚至超越了GPT-5系列模型。每个模型获胜,靠的不是原始智力,而是因为它为更窄、更具体的用途而构建或微调。

前沿模型可能知道如何做所有这些工作,但这并不意味着它是正确的工具。大型模型昂贵且不可预测,对于可能跨越数轮和数十万token的代理任务尤其如此。

NVIDIA将10亿参数作为小模型的分界线,但对开发者来说更重要的边界可能是模型是否小到可以自行运行。还有一整类模型不一定小,但仍然小到可以装在一块消费级GPU上。这包括Qwen 3.8 27B、Gemma 4 26B和GPT-OSS 20B等模型。这些模型即使没有专业化也很有能力,在基准测试中排名很高。但它们仍然可以在本地轻松运行,无需在GPU上花费数千美元。

运行较小的专业化模型不仅增加了效率;它为开发者提供了更现实的机会来训练和微调自己的模型,并在本地或云端托管模型,而不是依赖模型提供商来做这些。这反过来可以为开发者提供更多控制token的使用方式、输出的结构方式以及管道各部分如何单独改进——而不是假设最流行基准的改进会带来每项任务的改进。如上所述,较小的模型更容易微调,从而创造出更专业的AI。正如我的同事伊兰·施特劳斯所指出的,专业化是一种强大的经济力量。

如何训练它,在哪里运行?

使用现成的通用聊天模型最有力的论据往往是便利性。对于大多数任务,通用模型已经足够好,借助OpenRouter等产品,开发者可以轻松从数百个竞争能力和成本的模型中挑选,而无需投入前期工作来训练模型。正如Mozilla的拉菲·克里科里安在审阅本文时指出的,通用模型在公司生命周期早期也特别有意义,那时问题本身仍在定义中。在那个阶段,使用最大、最有能力的模型进行实验可以帮助团队确定确切的需求。但随着问题空间收窄和所需架构变得更清晰,对大型通用模型的需求可能也会减少。尽管许多第一方模型制造商已停止其微调产品,但微调和托管较小的模型仍然相对容易,这在很大程度上要归功于LoRA等参数高效技术。

LoRA

LoRA允许开发者微调模型而无需触及实际的模型权重。它通过附加相对少量在微调期间更新的可训练权重来实现。这很重要,原因有几个。小型适配器可以轻松传输,并且只要底层基础模型已经可用,提供新的LoRA不需要加载全新的模型。与完全微调不同,LoRA还降低了灾难性遗忘的风险。

训练LoRA比完全微调便宜得多,因为它只更新少量选定的权重。这可以使用Hugging Face Transformers或Unsloth等库在消费级GPU上完成。还有一些API模仿或改进了三大提供商曾经提供的微调API,例如Fireworks提供了一个直接的微调API,接受示例补全供其学习。除了SFT,Tinker允许开发者构建自定义的强化学习环境,奖励满足特定标准的结果,同时环境本身在开发者的机器上运行。

托管LoRA同样简单,并且重要的是,它可在跨平台移植。将完全微调的模型转移到新的API平台可能成本高昂,并且可能需要提供商在昂贵的GPU上单独托管您的模型。使用LoRA允许平台只需将一个小型适配器加载到他们已用于服务其他用户请求的模型上。这意味着微调LoRA不会将您锁定在特定平台,也不会强迫您租用自己的GPU。

超越模型权重的控制

正如Tim O'Reilly之前所指出的,开源AI不应止步于模型权重。同样,开发者构建自定义系统的可能性也不止于此。模型API本质上具有局限性,它们强加于您可以触及模型输入的哪些部分、可以缓存什么以及如何影响输出。回到国际象棋的例子,假设您有访问运行模型代码的权限,在输出时强制执行有效的国际象棋走法是容易的,但当您依赖的是为聊天机器人构建且无法修改的API时,这就不容易做到了。

自托管模型为您提供的控制水平远远超出了标准聊天补全API所能实现的,并允许您围绕任务构建模型,而不是围绕模型构建任务。微调只是专业化的一个方面。您还可以约束哪些输出是有效的,暴露和修改每个token的概率,缓存任何状态,并将特定于任务的逻辑直接添加到推理管道中。

这很重要,因为改进AI系统的默认方法已越来越多地转向寻求更有能力的通用模型。有时候这是正确的答案。但提高通用模型智能只是一个杠杆,而且往往不是最便宜或最可靠的杠杆。

1997年,没有人抱怨深蓝不会做菜谱,因为它除了下棋别无用途。通过专注于一个狭窄的问题,它能够在一场许多人曾认为机器永远无法征服的游戏中击败特级大师。

从大型语言模型在国际象棋中作弊的教训是,解决问题的最佳工具往往不是最通用的。超级通用智能并不会自动转化为专业化任务的高能力。相反的情况更接近事实。专业化机器智能需要大量数据,而且往往需要自己的管道。小模型可以帮助公司实现这一目标。

脚注