M5 Max上的本地模型性能实测
几天前,我读到了Mamonas.dev 的笔记本基准测试在一台五年车龄的2021年款M1 Pro上测试本地机型,配备16GB内存。我做过类似测试,但用的是2026款M5 Max,内存128GB。
总结
我在这台硬件上运行了6个最好的本地模型,并与Frontier型号在准确性和速度上进行了比较。他们实际上表现得出乎意料地好。
为什么要运行这个?
我对本地模型现在的表现挺感兴趣的,但因为我刚买了一台全新的MacBook M5 Max,配备128 GB我想看看最新的半普通消费级硬件在同样的基准测试上能做多好。
我说“半正常”是因为我不打算买什么疯狂的NVIDIA巨头,只是买高端消费级苹果笔记本。5000美元确实不少,但对于高级软件开发人员(或者像我这样,是个痴迷玩具的CEO)来说,这绝对是合理的。
我主要想了解几年内大多数本地笔记本会有哪些功能能广泛使用。如果公司或开发者担心代币成本或向第三方发送信息,我想看看在相对普通硬件上运行本地模型,是否与我们目前享受的前沿体验相近。
模型介绍
现在,与momonas.dev16GB M1能运行的型号和配备128GB统一内存的M5 Max型号差别很大。
在最初的博客文章中,他测试的模型都很小——谷歌上的两个gemma模型 (4:12b-it-qat,4:e4b-it-qat)以及阿里巴巴的三个Qwen模型(3.5:4b,3.5:9b,2.5:7b) - 大小都在 ~3-7GB 之间。
对于我的M5,我们可以加载更多新型号,所以我尝试了所有我认为有趣的方法。具体来说:
|模型 |制作者 |参数 |下载 |上下文窗口 | |--------------------------------------------------------------- |--------------------------- |---------------------- |-------- |--------------------- | |缪斯-闪光:30B-MLX|Meta(全新) |30B |21 GB |128K | |GPT-OSS:120B|OpenAI |120B MoE |65 GB |128K | |QWEN3-编码器:30b|阿里巴巴(Qwen)|30B MoE |18 GB |256K | |QWEN3.5:35B-MLX|阿里巴巴(Qwen)|35B |21 GB |256K | |GLM-4.7-闪光灯|Z.ai|30B |19 GB |~200K | |DeepSeek V4 闪光灯|DeepSeek,来自antirez的DS4 |304B MoE(2位量化) |87 GB |100万本地用户,运行速度为32K |
Deepseek 模型通过反雷斯/DS4项目服务器,其余部分则通过 Ollama 下载并运行。该圆周率编码代理工具用于运行同样一套测试,这些测试源自mamonas.dev描述。
Claude设计了22个问题,分为6个类别:5个DuckDB SQL,4个agentic pytest的bug修复,4个JSON提取,4个预测输出,3个快速事实,2个长文档查找。
你可以看看基准测试代码给你.
除了本地模型,作为对比,我用两个Frontier云模型——Opus 5和GPT-5.6 Sol——运行了完全相同的Pi套件。
结论
那么,本地模特表现如何?说实话,相当不错.
虽然Frontier的模型更快更准确,但说实话,差距没有我预期的那么大。这里有同一张速度与精度的图表:mamonas.dev二手(左上角最好)。
每个模型132次跑的通过率与总墙面时间。蓝色:M5 Max的本地配置。橙色:前沿API。悬停查看详情。
有趣的是,Frontier模型不仅最准确(这是意料之中的),而且速度也非常快,尽管我们还增加了云往返的网络开销。
从本地模式的角度来看,无论是新的缪斯·格林默来自Meta和OpenAIGPT 开源软件速度和准确度都很好。很酷的是,Muse型号最短只能运行32GB内存(gpt-oss更可能需要96GB或128GB配置),所以你甚至不需要我的MacBook Beast也能运行。
另外一点是,Qwen3 的编码模型非常快,因为它不是思考型模型,但即便如此,在这些示例测试中表现得相当不错。它失败的地方通常是因为不是思考(预测测试)。
准确性
大多数本地模型对我们设计的测试套件来说都非常准确。
与Mamona测试中部分模型未通过一半测试不同,几乎所有较大的本地模型都非常接近边境模型的表现。
通过132次运行(22题×6次运行),按代码评分:执行并diffed的SQL,pytest修复错误,逐字段提取,基于真实标准的预测。
前沿模型的有趣之处在于它们失败的地方——虽然Sol确实搞砸了一些SQL测试和一个预测测试,但这两个模型的其他失败都是与服务相关的。
Sol有一次电话服务过载,Opus因为“对违规网络内容的限制”拒绝回应。大概是因为我多次重复了同样看起来有点可疑的提示。
不过,除了阻止我试图实施的网络犯罪外,Opus 5是唯一一个在测试运行中没有出错的模型。
全面解析
所以,仅仅因为我可以,这里列出所有测试中的每个模型——全部1056次运行,按速度和准确度划分:
每次跑动的平均秒数,不包括暂停。绿色表示所有运行正确,黄色部分(含分数),红色无;每个格子的填充值是它与行中最慢格子的速度。
点击深入测试和运行。
首先,有一些有趣的总体观察。
你可以很清楚地看到Qwen3非思考模型是,以及它在预测运行之外的多个类别中的整体表现。
每个本地模型在7900个令牌运行簿查询中都完美无缺,包括Qwen3平均速度甚至超过了Frontier型号。这个测试赋予了模型这个5000字跑手还会问“集结堡垒监听哪个港口?”这样的问题。
另一个有趣的地方是非常棒Qwen3写SQL写得很快。它解决了所有这些问题,而且速度远快于Frontier车型。
从更一般的角度看,大多数本地模型在修复bug问题方面也非常出色,这些问题提供了一个小型的Python文件和测试文件,以及如下指令:
“这个目录里的测试套件失败了。找到并修复cart.py所以所有测试都通过了。不要修改测试cart.py.测试时用:./runtests.sh"
我会这么说缪斯在此类任务中通常比其他模型快得多,尽管它们大多数情况下都能解决(有些会循环超时)。然而,边境型号非常同样的问题更快,而且从未犯过错误。
你能别再在网上搜了吗?
一个有趣的问题是mamonas.dev帖子问:“你能别再在网上搜索了吗?”
我真正关心的速度问题是:简单查一下事实,问本地模型比搜索引擎好吗?
他发现gemma4:e4b以及qwen2.5模型在1秒内回复了诸如“Postgres使用的哪个端口”等问题的答案,而思考模型则需长达半分钟。
本地的模特都远没有那么慢。他的qwen3.5:4b模型在这个问题上平均得分为38分。相比之下,我本地几乎所有模型在这类快速问题上都比Sol快——几乎所有题目平均都在6秒以内。
回答“Postgres用哪个端口”类问题的中位数秒,模型已经加载。
再说一次,Qwen3-Coder不动脑筋的模型快得惊人。即使是思考模型,也和边疆的快速古格利式答案相当。
模型失败的地方
当本地模式失败时,他们遇到了哪些困难?
Python 2/3 预测测试
除了Opus(包括一半运行的Sol)之外,所有模型都能被欺骗的预测测试是:
funcs = [lambda: i for i in range(3)]
print([f() for f in funcs])
i = 99
print(funcs[0]())
Muse有三分之一的时间猜对了,GPT-OSS有一次,GLM-4.7有一次。Opus是唯一一个6次都做对的模型。Deepseek 和 Qwen 的两个模型都没做对。
显然,错误的答案是 Python 2 打印的内容,而不是 Python 3,因为变量重绑定不同。
幻觉SQL方言
一些型号(gpt-oss 和 GLM)尝试了 Postgres 的TOCHAR在DuckDB查询中。Qwen3.5 发明了formatdate()好了。
Chmod
其中一个问题是chmod rwxr-xr--模式是。正确答案是754,但Muse在这方面表现得很差,不知为何。它、Qwen3.5和GLM给了我750、744、752......
费用
所以,这个话题有点难以总结。当我们处理本地模型时,显然一个半有吸引力的特点是你不需要为推理付费。但计算成本节省有点棘手。
我们是在和订阅量或广告中的代币列表价格比较吗?缓存会如何影响这一点?这并不简单。
然而,事实是我为这次基准测试做了792次运行(6个模型 x 22个测试 x 6次运行 = 792次运行)大约移动了600万输入和100万输出标记。
所以如果我们非常直观地将这些成本与各种前沿云服务的API标价相比较,成本大致如下:
|提供者 |整个基准测试 | |--------------------------------- |--------------: | |克劳德寓言5(每100万美元 / 50美元) |$110.00 |GPT-5.6 Sol($5 / $30) |60美元 | |克洛德作品5($5 / $25) |55美元 | |GPT-5.6 Terra($2 / $12) |24美元 |
实际上,大型公司的成本几乎肯定更低。即使通过Pi使用Anthropic API,Opus的132次测试(~28.7万输入/~2万输出)的成本也只有1.80美元,整批大约是10美元(不是55美元)。
部分原因是缓存,部分原因是更好的代币效率。这里的情况比较复杂。
不过,将此与原博客文章的经济学进行比较很有趣。有了我的笔记本和新型号,我等待的时间更短,完全离线也能获得更好的精度。
如果只是因为一晚工作云费用10-20美元,而我的MacBook电费可能只有0.10美元,结果非常接近(至少在这些简单测试中显然如此),那就变得有些说服力了。
我真正会保留的东西
那么,这会改变什么吗?实际上,已经发生了。
我打算用Muse做一些完整的应用实验,看看效果如何(也许以后会再写一篇)。不过,我已经开始用 Ollama+Qwen3-Coder 来处理一些简单的事情,因为它速度快,而且据说相当准确。
另一个我感兴趣的领域是安全工作。我被Opus会议中(明显过度的)网络安全违规行为弄得很困惑。知道我可以向这些本地模特提出任何问题,他们不会因此责怪我,这让我很安心。