GLM 5.2 与 Opus
GLM-5.2刚刚发布,这又是开放模型能做的又一进步。网络上立刻震惊了,很难分辨什么是真实的,什么是炒作。
于是我们用它和Claude Opus 4.8一对一跑了一遍:同样的一次性提示,用原始WebGL从零构建一个3D平台游戏。这是我们完成测试、分析基准测试和热度后的感受。
我们不会关闭主武器Opus。在我们的测试中,Opus更快,发布了更干净、更准确的游戏,而且它能自行查看视觉输出,而纯文本的GLM-5.2做不到。
但GLM-5.2赢得了永久的武器库:它是一款真正能用的型号,价格却只有一小部分,而且因为它是开放式重量,所以永远保持可用性。封闭模型可能会在几乎没有预警的情况下被退役或限制(Fable是最近的提醒);你可以下载的权重无法被移除。
你现在可以同时玩这两个游戏,或者下载原始码:
- GLM-5.2的游戏: 3dgame-glm.d.ritzademo.com
- Opus的游戏: 3dgame-opus.d.ritzademo.com
- 两者的来源: github.com/ritza-co/glm-5.2-vs-opus-platformers
两者都是从零编写的浏览器游戏,没有像Three.js那样的游戏引擎或3D渲染库。3D模型是免费的CC0素材,来自肯尼.
以下是两轮的比较情况:
| 度规 | GLM-5.2(树莓派/OpenRouter) | Opus(克劳德密码) |
|---|---|---|
| 挂钟制作时间 | 1小时10分钟40秒 | 33分30秒 |
| 输出令牌 | 131,000 | 216,809 |
| 峰值上下文窗口 | 16%占1M的比例 | 19% 的100万 |
| 工具调用 | 128 | 153 |
| 费用 | 5.39美元(真实账单) | ~$21.92(估价,标价) |
GLM-5.2的价格只有一小部分。Opus完成时间缩短一半,游戏更干净。
理论上,GLM-5.2紧随顶级封闭模型之后,是真实信号和人造草坪的混合。比赛结束后我们将深入探讨两者。
什么是GLM-5.2
GLM-5.2 是Z.ai是最新的旗舰型号。它是MIT授权下的开放重量,所以你可以下载、自己操作,或者直接打电话Z.ai的API。
它专为长视野任务设计,也就是那种长时间、多步的编码代理工作,需要持续数小时。它配备了100万令牌的上下文窗口和两种思维努力等级,高和最大,速度换取能力。
注释
GLM-5.2 是纯文本,不是多模态。它不能读取图片,所以围绕截图或图表构建的工作流程仍然需要像 Claude Opus 这样的模型。
Z.ai大致在类似的代币使用率下,定位介于Claude Opus 4.7和4.8之间。如果你想了解更多,这是他们的公告:
@Zai_org X
价格与获取
因为是开放式重量,GLM-5.2 价格便宜。通过 API 它的费用只有 Opus 的一小部分,如果你有硬件,也可以自己免费运行。
按100万代币定价(供应商文档):
| 输入 | 缓存读取 | 输出 | |
|---|---|---|---|
| 克洛德作品4.8 | 5美元 | 0.50美元 | 25美元 |
| GLM-5.2 | 1.4美元 | 0.26美元 | 4.4美元 |
在输出代币上,GLM-5.2的价格不到Opus的五分之一。
权重在 HUGGING Face 和 ModelScope 上,采用 MIT 许可,没有地区限制。你可以用 vLLM、SGLang 或 Transformers 等框架本地服务。
我们的氛围测试:一款从零开始的3D游戏
为了打破这种氛围,我们给Opus 4.8和GLM-5.2都设定了同样的一次性提示:从零开始制作一款3D平台游戏,使用原始WebGL,没有游戏引擎或3D库。
为什么要做这项任务
模型可以零拍摄一个漂亮的落地页,社区已经把这当作测试工具。一个原始的WebGL3D平台游戏无法在一个漂亮的文件里伪造。它有真实结构:GLB模型解析器、矩阵和矢量数学、GLSL着色器、蒙皮骨骼动画、固定时间步循环、碰撞、跟拍镜头。
这种结构同时考验了人们争论的两方面。支撑一个层叠、多文件的构建经过多步骤是智能的部分,而GLM-5.2应当强大。把发动机内部结构做好,那些看起来没问题但悄悄坏掉的部分,是推理和品味的部分,Opus应该领先一步。
我们把3D资源本地捆绑在一起,所以测试的是引擎和渲染,而不是线束是否能抓取模型文件。艺术本身是一个人工制作的资产包,肯尼的CC0平台游戏套件两位特工都拿到了相同的文件。
每个模型需要建造的内容
最后,每个模型必须建造:
- 用原始的WebGL做3D引擎和渲染器,没有Three.js或任何库。
- 一个加载器,用于安装附带的3D角色和世界模型。
- 一个在竞技场里奔跑跳跃的角色,有重力和碰撞。
- 有跟随镜头和键盘控制。
- 整个过程可以用一个命令在浏览器里运行。
两者大部分都是手工完成的(用工具?用爪子?):GLB二进制解析器、矩阵和四元数数学、带GLSL蒙皮着色器的WebGL2渲染器,以及子步AABB碰撞以防止角色穿过平台。
两者都得到了相同的提示、相同的资源,还有一次尝试没有任何提示。我们用高频扩展思维运行了Opus 4.8,在高思考模式下运行了GLM-5.2(GLM-5.2还有一个更高的Max等级,我们没用过)。
你可以自己深入研究这两段游戏:
- 玩GLM-5.2的游戏: 3dgame-glm.d.ritzademo.com
- 玩Opus的游戏: 3dgame-opus.d.ritzademo.com
- 两者的来源: github.com/ritza-co/glm-5.2-vs-opus-platformers
- Opus 构建文字记录: 完整会议
- GLM-5.2 构建记录: 完整会议
花了多长时间,花费了多少
Opus 4.8 用 Claude 代码构建;GLM-5.2 在 Pi 上基于 OpenRouter 构建。
并排延时摄影。Opus在34分00秒结束,GLM-5.2在1分11秒结束。
延时摄影显示了整个构建的压缩:Opus大约用了一半的墙钟时间完成,GLM-5.2的刷取时间更长,但花费远低于预期。完整数据见顶部的结果表。
两款游戏的游戏测试
我们从头到尾都玩了两款游戏。以下是每款游戏的表现。
两者都打造了类似的游戏:一款第三人称3D平台跳跃游戏,操作方式相同。你用WASD或方向键移动,跳跃用空格键,用Shift键冲刺,通过拖动鼠标绕摄像机旋转,方向盘则可变放。
目标也是一样的:在平台收集金币,到达旗帜,避开尖刺陷阱,从世界坠落则回到起点。
GLM-5.2
GLM-5.2的游戏看起来有点粗糙。根据游戏流程:
- 整体看起来并不理想。
- 角色缺少了一些材料。
- 尖刺危险不会杀死角色。
- 到达旗帜也没用。没有胜利条件。
注释
更新:胜利条件确实有效。它要求先收集所有金币,标志才会触发。原版游戏缺少这一点。
所以其实也没那么好。不过它确实说中了一件事:弹簧。
GLM-5.2春季发射。
你可以跳上弹簧,然后跳到下一个平台。
作品
Opus的游戏更简洁,操作也流畅。以下是游戏体验:
- 摄像机和控制器都能正常工作。
- 尖刺危险会杀死玩家,所以这个逻辑是正确的。但它位于关卡侧面,而不是路径上,所以你得特意绕路才能击中它。
- 整体看起来不错,你能到达旗帜并获胜。这里有真正的胜利条件。
动画看起来不错,运行流畅,纹理应用得当。
Opus:动画、贴图、手柄工作。
每个模型如何检查自己的工作
两款模型都被告知在停止前要核实工作。一个常见的做法是截屏成品并查看,确认没有损坏或缺失。这正是Opus在会议中所做的。
GLM-5.2 在这里遇到了问题,因为它无法读取图像。它不是多模态的。所以它没有看截图,而是采用了一个简陋的变通方法:写脚本读取原始像素数据,检查颜色是否大致符合预期。
为什么GLM-5.2的自我检查漏掉了这些漏洞
由于无法看到已保存的截图,GLM-5.2 尝试通过读取像素来验证帧数。以下是其最终报告中的一段摘录,内容是通过采样颜色“分析”已保存图像:
final_start/overview/flag.png颜色分析:草绿、泥棕、金币、旗红色、角色蓝色、半兰伯特灯,无黑色它预期的颜色都在那里,所以确认游戏已经结束并停止了。但正如你在下面最后截图中看到的,角色是平面灰色,纹理缺失,调试叠加层仍然悬挂在场景上。
一个能看截图的代理很可能会发现两者,并回去修复它们。
GLM-5.2的最终截图:角色纹理缺失,调试覆盖层依然开启。它从未看到帧。
在有视觉效果的任务中,能够理解图像会让模型比不能理解的模型更具优势。
Opus如何检查其工作
Opus是多模态的,所以它可以直接读取截图。它的束缚器渲染了游戏并捕捉了帧,Opus在验证时检查了那张图片。以下是摘录会议描述了它所看到的情况:
最终场景渲染正确:草地方块配棕色泥土侧面,楼梯攀爬,金银硬币和宝石,右岛上的蓝色尖刺方块障碍,顶端球门的红旗,角色站在起始广场,以及比分HUD。光照和阴影正确,几何体干净利落。
Opus的截图:干净的HUD,调试显示被移除。
因为能看到画面,Opus注意到屏幕上留下的调试显示,并在完成前清除了它们。
虫子
两款游戏都有漏洞。以下是各自的故障。
GLM-5.2
GLM-5.2的bug频繁且明显,其中几个是基础问题。
角色面向错误的方向。它朝着正确的方向走,但模型始终是反着的。
缺少纹理和消失的头部。角色渲染的是平面灰色而非纹理,且当摄像机移动时,角色的头部会消失。Kenney模型指向一个共享调色板,而不是嵌入文件,GLM-5.2的渲染器从未加载该文件,因此又回到了平面颜色。
Opus加载了调色板,因此角色呈现出纹理。
死亡激增不会致命。角色正好落在尖刺危险处,什么都没发生。没有死亡,没有重置。
作品
Opus更少且更为微妙,是边缘案例而非破碎的基础。
站在空气中。角色可以坐在平台旁,悬空而不会坠落。这是它的“郊狼时间宽限期”,即你刚从边缘跳跃的短暂窗口,调校得稍显宽松。这是一个稍显过度的打磨功能,而非破坏基本功。
从太远的距离赢得胜利。胜利触发时,角色还远未达到旗帜。
测试结果
两款模型从零开始打造了一个完整的运行3D平台游戏,没有引擎和3D库,一次过完成。这是个很高的标准,不久前两者都无法达到。以下是它们的分工方式。
GLM-5.2:速度慢、粗糙、便宜
GLM-5.2耗时超过两倍,发布的游戏质量很粗糙:一个灰色无纹理的角色,一个无法杀死人的尖刺,最后屏幕上还显示着调试叠加层。它的大部分漏洞都是基本问题。
成本只有五分之一。
Opus:更快、更干净、更贵
Opus只用了一半的时间,发布了更干净、更准确的游戏。它的bug是边缘案例,不是破碎的基本问题。价格大约是它的四倍。
多模态优势
Opus可以读取图像,因此其自我检查会查看渲染后的游戏并发现视觉问题。GLM-5.2是纯文本版本:通过数字验证,从未发现角色是灰色的,也没发现调试覆盖层还在。
在视觉任务中,这就是捕捉粗糙边缘和发布的区别。
一场比赛就是一个数据点。下面的基准测试的都是同样类型的大规模能力。
基准测试
Z.ai在发布时发布了这些基准数据,在其型号卡.每行中最佳结果为粗体.
*=人为自报.
| 基准测试 | GLM-5.2 | 作品4.8 | GPT-5.5 | 双子座3.1 Pro |
|---|---|---|---|---|
| 推理 | ||||
| HLE | 40.5 | 49.8* | 41.4* | 45 |
| 高强度教育(带工具) | 54.7 | 57.9* | 52.2* | 51.4* |
| 爱 2026 | 99.2 | 95.7 | 98.3 | 98.2 |
| GPQA-钻石 | 91.2 | 93.6 | 93.6 | 94.3 |
| 依我看,安斯沃尔Bench | 91.0 | 83.5 | – | 81 |
| 编码 | ||||
| SWE-bench Pro | 62.1 | 69.2 | 58.6 | 54.2 |
| NL2仓库 | 48.9 | 69.7 | 50.7 | 33.4 |
| DeepSWE | 46.2 | 58 | 70 | 10 |
| ProgramBench | 63.7 | 71.9 | 70.8 | 39.5 |
| 终端工作台2.1(终点站-2) | 81.0 | 85 | 84 | 74 |
| 终端工作台2.1(最佳背带) | 82.7 | 78.9 | 83.4 | 70.7 |
| SWE马拉松 | 13.0 | 26.0 | 12.0 | 4.0 |
| 能动性 | ||||
| MCP-Atlas(公开) | 76.8 | 77.8 | 75.3 | 69.2 |
| 工具十项全能 | 48.2 | 59.9 | 55.6 | 48.8 |
独立运营人工分析大致同意:
- 智力指数v4.1:51(领先的开放重量级;MiniMax-M3 44,DeepSeek V4 Pro 44,Kimi K2.6 43)。
- TerminalBench v2.1:78%(相比型号卡上的81 / 82.7——不同的线束)。
- 每个任务输出令牌数:~43k(GLM-5.1:26k)。
数据与我们的测试相符:GLM-5.2在开权重组中领先,推理上互有攻势,但Opus仍占据大部分编码和代理行。
每个基准衡量的内容
这些基准测试涵盖三个领域。以下是每个基准测试的内容,按表格的分组方式排列。
推理困难的数学和科学考试:
- HLE.人类的最后考试。数千道专家级题目,涵盖多个学科,设计得极其困难。“使用工具”这一行是同一份考试,允许网页搜索和代码。
- 爱 2026.一场艰难的美国高中数学竞赛。
- GPQA-钻石.研究生水平的科学问题写成了无法快速搜索就能回答的。
- 依我看,安斯沃尔Bench.数学奥林匹克式题目,最终答案得分。
编码修复漏洞并构建完整项目:
- SWE-bench Pro.修复真实代码库中的真实问题,通常会跨多个文件进行修改。
- NL2仓库.从单一规范构建一个完整、可运行的代码库。
- DeepSWE.在没有互联网的沙箱容器中完成代理软件工程任务。
- ProgramBench.仅从编译后的二进制文件和文档重建完整程序,且不提供来源或规范。
- 终端工作台 2.1.任务通过真实终端完成。两排使用固定线束(Terminus-2)和各型号最佳线束。
- SWE马拉松.二十项超长距离工程任务,每项工作持续数小时。
能动性调用并串联真实工具:
人们说的
基准测试和我们自己的测试是一回事;网络上的反应则是另一回事。很多都是没有业绩记录的账号炒作,所以我们选择了那些判断经得起时间考验的人和团体。
Simon Willison:“可能是最强大的纯文本开放权重LLM”
多年来,西蒙·威利森几乎为所有著名模型发布撰写了文章。他称为GLM-5.2“可能是最强大的纯文本开放权重LLM。”
他的标准测试是请模型制作一只鹈鹕骑自行车的SVG。GLM-5.2返回了一个完整动画且无损坏的SVG,他称之为“非常令人印象深刻”。
第二个测试是一只骑踏板车的负鼠,结果比GLM-5.1之前做的版本还要差。所以它很强,但并不均匀。
人工分析:顶级开放模型,但极度依赖代币
Artificial Analysis,一个独立的基准测试组织,排名GLM-5.2这是其智能指数中领先的开放权重模型。它得分为51,领先于MiniMax-M3、DeepSeek V4 Pro和Kimi K2.6,并且在成本与智能的竞争中处于同级别最便宜的模型。
@ArtificialAnlys 在 X 上
他们标记了我们遇到的同样问题:它对token需求很高。它每个任务大约用4.3万个输出token,其中大部分是推理的,比他们测量过的任何领先的开放模型都多。
内森·兰伯特:开闭差距正在缩小
Nathan Lambert 在艾伦人工智能研究所追踪无权级模型。观察 GLM-5.2 在 LMArena 排行榜上的排名,他有人辩称“你可以说他们有比Gemini更好的代理”,并称这是MIT授权的开放模式“一项重大成就”。
@natolambert 在 X 上
他更广泛的观点是,中国实验室在更少的计算量下达到了这些分数,即使顶级美国型号整体仍领先,也不应被忽视。这与我们的测试一致,Opus领先,但GLM-5.2的价格和开放性显示的更接近。
判决
那么,炒作是真的吗?大部分是。
GLM-5.2 是一款真正强大的开放模型,价格仅为 Opus 的一小部分。对于大量工作来说,这种组合很难被超越。但它不是 Opus。在我们的测试中,Opus 更快,发布的游戏更干净、更准确,并且可以通过观察来验证自己的工作。
GLM-5.2 价格低得多,但更粗糙,而且它只有文本。
当成本和开放性重要,且工作主要是文字和逻辑时,使用GLM-5.2。当正确性、精致和视觉判断重要时,使用Opus,你会为此付出代价。无论如何,GLM-5.2都应保留在武器库中:它是罕见的与边疆相关型号,任何厂商都无法夺走。