我思我想:为什么我偏爱本地部署的开源大模型

在公司内部待上一段时间时,我曾提到自己想尝试一款特定的工具,只不过打算使用本地托管的大型语言模型, 而非云端托管的模型。对方的回应基本上就是:“LULZ,你真想这么做? ”不仅让我对这番话感到有些意外,更让我意识到,自己内心深处其实迫切地想要把原因说清楚——不过, 这种表达方式更适合写成一篇博客文章,而不是发在 Slack 上。

(这是我系列博客文章中的一部分,我会大声思考、畅谈那些“我自以为在思考的事情”。 我发现,把自己的想法写下来,有助于我重新认识、归类并总结这些想法。 如果你也觉得这些内容有启发,亲爱的读者,我当然非常高兴; 但请记住,我写这些文章的目的,并不是为了说服或教育他人——事实上,可以说, 我写这些文章的目的,根本就不是为了你。 )

本地优先的大型语言模型

首先,需要先做个简单的说明:当我谈到将人工智能基础设施部署在本地、而非云端时, 我通常指的是一个高度依赖开源社区的架构方案——毕竟,目前市面上真正能本地托管的商业选项几乎还不存在。 我也不确定这种情况是否会在不久的将来发生改变,但说实话,我并不觉得有理由期待会有变化——毕竟, 从40年前你只需买一份 Office 套件,然后将其安装到本地机器上,到如今商业选项全都是云端托管,而只有开源版本(比如 LibreOffice)才支持本地安装,这一转变已经发生了。 我猜测,这其中很大程度上与软件盗版问题有关,以及“我该如何让用户的本地安装行为发生微妙变化, 即便他们从未给我钱、也未提供任何许可证密钥? ”这类问题息息相关——与其费心去搭建和维护那些商业化的服务,不如干脆直接把它们托管在云端, 这样要简单得多。而且,我完全不认为这种状况会在“很快”、甚至“永远”内发生改变。

当然,这个架构体系的另一大支柱,便是硬件——你的机器必须配备一张性能强劲的 GPU(或者多张 GPU),才能运行与云端大型语言模型相媲美的模型。 顺便一提,我桌上的游戏主机搭载了一块 NVIDIA GeForce RTX 4090,考虑到它至少已有将近一年的历史,这其实算不上差。 当然,它肯定无法在竞赛中与 Cray 相抗衡,但毫无疑问,它在运行大型语言模型时的表现,远胜过普通的 ChromeBook。

此外,我在大型语言模型相关软件栈中所见到的许多技术,似乎都围绕着 Anthropic API 集群迅速发展起来。以 Ollama 为例,它能够模仿 Anthropic API,让 Claude Code 无需依赖其原生服务器,只需通过设置一些本地环境变量,即可使用 Anthropic API:

……然后,只需启动 Ollama 模型,就像启动 Claude ——model qwen3.5 一样。或者,Ollama 还可以帮你处理这些细节,你只需运行 ollama launch claude,剩下的事情就会自动搞定。

为什么?

当我在思考这个问题时,脑海中浮现出四个主要的要点:

1. 分布式计算的谬误

2. 2020年代人工智能公司的经济逻辑

3. Hermitude 的安全性

4. 回报的便捷性

5. 自主托管的清晰度

分布式计算的谬误

2026年3月2日格林尼治时间11点49分,一件不可思议的事发生了:Anthropic 的服务器突然宕机,导致 Claude Code 也陷入停摆。全世界都注意到了这一事件——而这在很大程度上是因为, 不仅生产力指标大幅下滑,就连纸牌游戏的得分也飙升了1。

许多人再次以惨痛的代价认识到:Claude Code 和许多其他系统一样,是一个分布式系统,因此它始终会受到分布式计算谬误的制约:

1. 网络可靠;

2. 延迟为零;

3. 宽带无限;

4. 网络安全;

5. 网络拓扑不会改变;

6. 只有一位管理员;

7. 运输成本为零;

8. 网络是同质的。

这些假设,是每一位分布式系统开发者在人生某个阶段都会做出的判断。 然而,一旦这些假设被证明为假,往往就会引发令人痛苦的后果——正如我们所经历的那样。 诚然,如今的网络比二十年前,甚至十年前有了显著改善,但它们依然存在脆弱性, 而这些脆弱性并不会因为上述八项假设中的任何一项而消失。

人们常常会想:“这种事情可没经常发生,况且我们在飞机上,即使在海拔四万英尺的高空, 也早已装上了 WiFi……”但这样做实际上等于逃避了应对故障模式的责任——而这些故障模式往往会在最尴尬的时刻悄然降临。 在互联网刚刚兴起的时候,我们构建的系统一旦网络中断,几乎就彻底瘫痪了; 随着时间推移,我们又逐渐开发出了一些方法,试图弥补这一缺陷。 当然,后来移动设备问世,虽然我们曾兴奋地期待能在设备上拥有真正的 CPU 和存储空间(其中大部分都用来玩各种游戏),但我们很快又开始开发那些在没有网络时无法运行的应用程序, 却同样意识到:在万一网络中断时,我们仍然需要有一个完善的备用方案。

如今,随着越来越多的企业开始打造“AI驱动”或“代理型”应用,我们很快就会发现: 这些应用本质上不过是将 OpenAI 或 Anthropic 的 AI 模型调用封装成了一个个“包装器”。请记住,当你进行这样的操作时,你并不是仅仅依靠 OpenAI 或 Anthropic 能够维持的正常运行时间来保证自己的服务可用性——你还要将自身服务的正常运行时间, 建立在他们的互联网服务提供商、他们所使用的云托管服务商、你与他们之间的电信骨干网、 你当地的互联网服务提供商,乃至你本地网络的正常运行时间之上。 (看看你们吧,Comcast! )关键在于:分布式系统天生就比本地系统更加脆弱。

这也引出了我的下一个观点:“如果我们可以将大型语言模型托管在本地,那么就能减少一条传输链路, 从而避免因故障而导致整个系统陷入瘫痪。 ”在我看来,在接下来的几个月和几年里,这一点将变得愈发重要——坦白说,无论我们如何防范故障, 只保留一个单一的故障点,几乎总是个糟糕的主意2。

更不用说,这种方式的成本要低得多,这也引出了我的下一个观点。

“AI”公司的经济逻辑

简而言之,我坚信当前的人工智能公司市场正处于泡沫之中,而且我深信,这场泡沫终将破裂。 这并不意味着 OpenAI 或 Anthropic,甚至微软、谷歌、亚马逊或甲骨文会破产。 但这场泡沫的破裂,无疑将在整个行业掀起巨大的连锁反应,大量原本支撑着种种极度不可持续的商业假设的资金, 也将化为乌有。

关于我为何如此认为的深入探讨,我建议大家阅读 Ed Zitron 的文章;如果你想深入了解他最新的见解(截至撰写本文时),不妨去看看 《次级AI危机已至》。 我实在无法用更好的方式来解释这一切,但我还是要提醒你:如果你想和他争论, 最好至少拥有经济学或金融学的本科学位,因为他可不是那种只会泛泛而谈、随意打发细节的人。

顺便一提,首批 广告测试 已经开始显现端倪。而 Anthropic 之所以尚未公开提出在 Claude 中投放广告的想法,只是因为他们最近非常积极地拿 ChatGPT 来“调侃”——也就是说,他们已经将自己排除在这一选项之外,至少长达七天之久(而这正是我们这个社会“遗忘”某件事所需的时间; 如果你想了解更多,请查看newslifespan.com)。

但问题的关键在于:

• 目前所有涉足“AI”领域的公司,支出远远超过收入。

• 这一差距正由风险投资资金(或更具创意的会计手段)来填补。

• 风险投资资金和创意会计手段终究无法无限期持续下去。

……这就让我们不得不得出一个不可避免的结论:要么,参与“AI”行业的公司必须找到办法, 让自身的收入超过支出;这样一来,所有员工的薪资成本也会随之上升,最终转嫁到那些习惯于免费获取一切的消费者身上; 要么,当风险投资的润滑剂耗尽时,整个行业将轰然崩塌。 又或者,(a) 和 (b) 的某种组合——无论如何,这都将给整个行业带来一场极其严重的“坏消息”浪潮。

而这一切,恰恰可以由那些正在考虑本地优先的大型语言模型托管方案的人们来妥善应对。

编辑日期:2026年4月6日:近期Anthropic 对 OpenClaw 的禁令实际上意味着,用户将无法再通过 Claude 订阅来运行像 Open Claw 这样的第三方插件;“取而代之的是,如果用户想使用 OpenClaw 运行 Claude,就必须选择‘按需付费’的方式,该方式将单独向其 Claude 订阅费用之外收取账单。”他们之所以这么做,有很多合理的理由,但其中一个最重要的原因,就是成本。无论如何,这一进展至少可以说是相当有趣。 Hermitude 的安全性

实际上,还有第三种(呃,第四种?)可能性,能够为人工智能公司带来收益——而大多数 SaaS 公司早已证明,这种可能性实在太诱人,不容忽视:(d) 我们会把你的数据卖给最高出价者。

你愿意吗?你与 ChatGPT 的每一次对话,突然都被分析并出售给广告商,而这些广告商随后会不断向你推送各种你原本以为自己会私下与 ChatGPT 交流的内容?想想看,有多少人把 ChatGPT 当作婚姻咨询师, 又或是心理健康专家……我倒不太确定自己是否能接受这样的安排。

不过,从企业层面来看,如果你的公司正将 Claude 或其他代理工具纳入决策或仪表盘的核心流程,那么你实际上就是在信任:在任何时刻, 所有这些源源不断地流入和流出 LLM 的数据(还记得“token”吗?)都不会被视为“新石油”,也不会被卖给出价最高者。 别误会!Anthropic 根本不会考虑这么做,就像 Google 一直秉持着那句“勿做恶”的座右铭——他们一遍又一遍地告诉我们,这句话正是企业文化的核心所在3。

回报的便捷性

如果事实证明,我所设想的种种情景——不仅能让 AI 公司找到办法,让每1美元的收入,永远都能覆盖10美元的支出; 而且,互联网还能瞬间转变为一个可靠性极高的堡垒,其性能甚至超越物理定律的限制——那么, 切换到使用云端服务,其实也就变得格外简单。

自我托管的清晰度

最重要的是,当你必须自己构建一套完整的系统时,你总能学到很多东西。 比如,如何让 Ollama 正常运行,如何确定哪些模型应该本地托管,如何让OpenWebUI、 Claude、OpenCode、 VSCode、n8n 或 marimo 与之协同工作,如何区分 Ollama 与 vLLM 或 LlamaCpp——这些经历本身既富有教育意义, 又能帮助你深刻理解这一切背后的运作机制。

因为说实话,真正的力量就在于此:学会将这些组件巧妙地组合在一起,这样你就能看清所有的线路、 数据流动,以及静止状态下的运行情况等等。 即便我们今后编写代码的次数会越来越少(这也暗示着,未来我们可能会更多地扮演架构师的角色, 而非过去那种“代码猴子”式的角色),但总得有人懂得如何将这一切有机地连接起来, 使之与公司的目标、利益和关切相契合。

而我,也希望能成为那个“某人”之一。 1. 其实,除了我之外,还有人玩纸牌游戏吗?现在的孩子们都在用什么?扫雷?侠盗猎车手?还是在 Steam Deck 上玩什么?对着云朵挥舞拳头!

↩ 2. 这也解释了为什么我百分之百支持政府主导的太空探索与研究。我们越早减少对地球中心生活的依赖,我们的物种就越能在面对潜在危险时保持更强的韧性。不过,这又是另一个话题了——而且很可能还得来几杯苏格兰威士忌。如果你希望尽早听到这些想法,不妨来参加一场会议,把你的钱投进点唱机(也就是给我买一瓶麦卡伦,双份,纯饮),然后做好心理准备,一路听完整个播放列表。

↩ 3.直到它不再适用。

↩

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论