一年来 LLM 部署成本几乎增加了两倍

MWS Cloud 分析了运行世界领先的俄罗斯大语言模型的计算基础设施需求。据估计,运行一种模型的最低 Nvidia 加速器组的平均成本已从 1370 万卢布增加。 2025年达到3880万卢布。 2026 年——2.8 倍。

来源:OSP网站大数据新闻

来源:rawpixel.com (CC0)

MWS Cloud 的分析包括 2025 年春夏和 2026 年春夏发布的流行开放型号。对于 2025 年,考虑了 Kimi K2、gpt-oss-120b、Gemma 3 27B、GLM-4.5V、Qwen3 235B 和 Russian Cotype Pro 2。 2026 年 - Kimi K3、Qwen3.5 397B、DeepSeek-V4-Pro、DeepSeek-V4-Flash、GLM-5.2、Gemma 4 和 Cotype Pro 3。

计算运行模型和处理最大指定大小的一个请求所需的最少视频卡数量。该价格包括带有 GPU 的服务器及其交换机。

新的法学硕士正在变得更加强大:它们更擅长处理复杂的问题,并且可以在单个查询中容纳更多信息。然而,要做到这一点,它们需要更多的内存和更快的 GPU。同时,显卡本身的成本也在增加,因此部署的机型也更加昂贵。

另外,MWS Cloud 评估了中国华为 Ascend 910B 加速器上的可能配置。尚未对所有受审查的法学硕士确认启动它们的可能性:在 2025 年的样本中,六分之三的模型可以确认,而到 2026 年,七分之五的模型可以确认。

在已确认或实验确认支持华为的型号中,2025 年平均需要 10.7 个 Ascend 910B 加速器,2026 年需要 13.6 个。这些 GPU 没有官方价格,但估计可能是同类 Nvidia GPU 成本的一半到三分之二。

研究显示,47% 的受访者预计未来 12 个月内 GPU 资源的成本将会上升,45% 的受访者认为它们对业务的重要性将会增长。在自己的基础设施上部署大型模型变得越来越昂贵,但没有单一的价格限制,之后市场将对人工智能失去兴趣:如果购买设备不再有回报,公司会选择更紧凑的模型、优化计算或迁移到云端。