如果这项研究属实,超大规模云厂商的护城河要塌了

如果这项研究属实,超大规模云厂商的护城河要塌了 图片 1

在我的常规研究中(需付费订阅),我已多次指出:我认为人工智能的未来不在于大型语言模型(LLM),而在于可在本地台式机甚至手机上运行的小型语言模型(SLM)。

今年5月,斯坦福大学的一个团队发表了研究成果发表了一项研究,将这些小型语言模型与数据中心内运行的大型语言模型的性能进行了对比。

如果他们的结论属实,那么未来我们将几乎不再需要数据中心,而那些超大规模云服务商则在数百亿美元的投资上白白浪费。

说真的,如果你是一名试图在人工智能热潮中寻找投资方向的投资者,就必须通读这篇论文。不过为了让你快速了解,我先列出几个关键发现。

首先,他们选取了一系列可下载到本地PC上的小型语言模型(QWEN 3、GEMMA 3、GPT‑OSS、GRANITE 4.0),并将其性能与云端最先进的大型语言模型(ChatGPT 5、Claude Sonnet 4.5、Gemini 2.5 Pro)进行了比较。

这些小型语言模型分别在搭载NVIDIA芯片或苹果M4芯片的本地PC上运行——这两种硬件如今在高端台式机中十分常见(整个研究是在在英伟达推出其PC用AI芯片之前平台上完成的,这将进一步加速从数据中心向桌面端部署的迁移)。

随后,他们追踪了这些小型语言模型与大型语言模型在2023年至2025年10月期间,在对话任务和推理任务上的表现差异。

下图展示了小型语言模型在对话请求中的胜率/平局比率——而对话请求至今仍占绝大多数。可以看出,在各个领域,表现最佳的小型语言模型都能在90%以上的案例中给出与大型语言模型相同甚至更优的答案,所有领域的平均值高达98.6%。

小型语言模型与大型语言模型在对话请求中的胜率/平局比率

来源:Saad‑Falson等(2026)

至于要求更高的推理任务,小型语言模型也在迅速追赶。平均而言,它们在62.5%的案例中能提供与大型语言模型同样优秀或更好的答案。

小型语言模型与大型语言模型在推理任务中的胜率/平局比率

来源:Saad‑Falson等(2026)

然而,在实际应用中,小型语言模型和大型语言模型处理的任务往往是对话与推理的混合体。因此,第三张图表基于各领域任务的发生频率,给出了对话与推理两类任务的加权平均表现。

结果显示,平均而言,小型语言模型在81.2%的案例中表现不逊于大型语言模型,后者仅在工程、生命科学、交通运输和计算机科学等领域仍具显著优势。

小型语言模型与大型语言模型在对话与推理任务中的胜率/平局比率

来源:Saad‑Falson等(2026)

但这不仅仅是准确率的问题。小型语言模型以比大型语言模型低50%至85%的能耗和计算成本实现了上述性能,具体数值取决于所用的小型语言模型及硬件配置。

此外,小型语言模型在推理任务上的进步尤为迅猛。最后一张图表展示了小型语言模型在纯推理任务中随难度等级和模型迭代的变化情况。

2023年,小型语言模型在五级难度中的整体成功率约为50%左右。到了2025年10月,它们在最简单的1—2级任务中已达到99%的成功率,在较难的3—4级任务中也达到了85%至92%,唯有最难的5级任务仍略逊于大型语言模型(成功率为51.5%)。

小型语言模型在推理任务中的成功率

来源:Saad‑Falson等(2026)

这意味着,在五类典型应用场景中,已有四类可以用小型语言模型替代数据中心及其昂贵的尖端半导体基础设施。研究报告估算,美国市场中面向小型语言模型的潜在规模已达约10万亿美元,约占美国30万亿美元GDP的三分之一。

留给大型语言模型的生存空间已所剩无几,且其相对于小型语言模型的优势正逐年缩小。

当然,仍有少数领域大型语言模型占据明显优势,尤其是在代理型AI应用中,小型语言模型目前的准确率和成功率尚不足50%。此外,这些小型语言模型在智能手机上的运行也面临一定局限,能在iPhone上流畅运行的版本性能远逊于台式机端的同类模型。

但——这一点至关重要——无论是台式机还是智能手机上的小型语言模型,其能源效率都远高于云端部署的大型语言模型。这些小型语言模型每瓦特的推理能力通常是大型语言模型的七倍。

这意味着,当遇到可在桌面甚至移动端解决的任务时,就地处理的成本远低于将其发送至数据中心。

在我看来,这对投资者具有重要启示:

  • 我们需要的数据中心数量远比想象中少。既然已有70%至80%原本预期由大型语言模型承担的任务可以由小型语言模型替代,那么超大规模云服务商未来的收入增长根本不足以支撑其巨额资本开支。事实上,如果这项研究成立且趋势持续,数据中心很可能成为当前人工智能领域中最糟糕的投资标的。
  • 尽管我们仍需对各类半导体进行大量投入,但并不必一味追求最先进的NVIDIA芯片;能够满足桌面需求的中低端型号即可。对NVIDIA而言,最好的局面是将其高端数据中心GPU逐步替换为面向桌面的新产品。这又将如何影响其未来的利润率和收入增长?
  • 对于最复杂的任务,我们仍然离不开大型语言模型,像OpenAI、Anthropic等公司也可以将部分模型“降维”为小型语言模型并作为替代品销售。然而,面对来自QWEN、IBM GRANITE等中国厂商的激烈竞争,这类产品的利润率将远低于大型语言模型。这又会对这些公司在计划中的IPO估值及长期发展轨迹产生怎样的影响?
  • 虽然代理型AI目前仍更适合大型语言模型,但这或许只是暂时的优势,正如我们在推理任务和单轮对话中看到的那样。若果真如此,真正受益于人工智能浪潮的将不是先进硬件和数据中心的提供商,而是戴尔、苹果等默默无闻的台式机制造商。

这场竞赛的发展过程将充满看点,而我也愈发确信,许多人会因押错了技术方向而蒙受重大损失。

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论