GLM 5.2 与 Opus

显示原文

GLM-5.2刚刚发布,这又是开放模型能做的又一进步。网络上立刻震惊了,很难分辨什么是真实的,什么是炒作。

于是我们用它和Claude Opus 4.8一对一跑了一遍:同样的一次性提示,用原始WebGL从零构建一个3D平台游戏。这是我们完成测试、分析基准测试和热度后的感受。

我们不会关闭主武器Opus。在我们的测试中,Opus更快,发布了更干净、更准确的游戏,而且它能自行查看视觉输出,而纯文本的GLM-5.2做不到。

但GLM-5.2赢得了永久的武器库:它是一款真正能用的型号,价格却只有一小部分,而且因为它是开放式重量,所以永远保持可用性。封闭模型可能会在几乎没有预警的情况下被退役或限制(Fable是最近的提醒);你可以下载的权重无法被移除。

你现在可以同时玩这两个游戏,或者下载原始码:

两者都是从零编写的浏览器游戏,没有像Three.js那样的游戏引擎或3D渲染库。3D模型是免费的CC0素材,来自肯尼.

以下是两轮的比较情况:

度规GLM-5.2(树莓派/OpenRouter)Opus(克劳德密码)
挂钟制作时间1小时10分钟40秒33分30秒
输出令牌131,000216,809
峰值上下文窗口16%占1M的比例19% 的100万
工具调用128153
费用5.39美元(真实账单)~$21.92(估价,标价)

GLM-5.2的价格只有一小部分。Opus完成时间缩短一半,游戏更干净。

理论上,GLM-5.2紧随顶级封闭模型之后,是真实信号和人造草坪的混合。比赛结束后我们将深入探讨两者。

什么是GLM-5.2

GLM-5.2 是Z.ai是最新的旗舰型号。它是MIT授权下的开放重量,所以你可以下载、自己操作,或者直接打电话Z.ai的API。

它专为长视野任务设计,也就是那种长时间、多步的编码代理工作,需要持续数小时。它配备了100万令牌的上下文窗口和两种思维努力等级,高和最大,速度换取能力。

注释

GLM-5.2 是纯文本,不是多模态。它不能读取图片,所以围绕截图或图表构建的工作流程仍然需要像 Claude Opus 这样的模型。

Z.ai大致在类似的代币使用率下,定位介于Claude Opus 4.7和4.8之间。如果你想了解更多,这是他们的公告:

@Zai_org X

价格与获取

因为是开放式重量,GLM-5.2 价格便宜。通过 API 它的费用只有 Opus 的一小部分,如果你有硬件,也可以自己免费运行。

按100万代币定价(供应商文档):

输入缓存读取输出
克洛德作品4.85美元0.50美元25美元
GLM-5.21.4美元0.26美元4.4美元

在输出代币上,GLM-5.2的价格不到Opus的五分之一。

权重在 HUGGING Face 和 ModelScope 上,采用 MIT 许可,没有地区限制。你可以用 vLLM、SGLang 或 Transformers 等框架本地服务。

我们的氛围测试:一款从零开始的3D游戏

为了打破这种氛围,我们给Opus 4.8和GLM-5.2都设定了同样的一次性提示:从零开始制作一款3D平台游戏,使用原始WebGL,没有游戏引擎或3D库。

为什么要做这项任务

模型可以零拍摄一个漂亮的落地页,社区已经把这当作测试工具。一个原始的WebGL3D平台游戏无法在一个漂亮的文件里伪造。它有真实结构:GLB模型解析器、矩阵和矢量数学、GLSL着色器、蒙皮骨骼动画、固定时间步循环、碰撞、跟拍镜头。

这种结构同时考验了人们争论的两方面。支撑一个层叠、多文件的构建经过多步骤是智能的部分,而GLM-5.2应当强大。把发动机内部结构做好,那些看起来没问题但悄悄坏掉的部分,是推理和品味的部分,Opus应该领先一步。

我们把3D资源本地捆绑在一起,所以测试的是引擎和渲染,而不是线束是否能抓取模型文件。艺术本身是一个人工制作的资产包,肯尼的CC0平台游戏套件两位特工都拿到了相同的文件。

每个模型需要建造的内容

最后,每个模型必须建造:

  • 用原始的WebGL做3D引擎和渲染器,没有Three.js或任何库。
  • 一个加载器,用于安装附带的3D角色和世界模型。
  • 一个在竞技场里奔跑跳跃的角色,有重力和碰撞。
  • 有跟随镜头和键盘控制。
  • 整个过程可以用一个命令在浏览器里运行。

两者大部分都是手工完成的(用工具?用爪子?):GLB二进制解析器、矩阵和四元数数学、带GLSL蒙皮着色器的WebGL2渲染器,以及子步AABB碰撞以防止角色穿过平台。

两者都得到了相同的提示、相同的资源,还有一次尝试没有任何提示。我们用高频扩展思维运行了Opus 4.8,在高思考模式下运行了GLM-5.2(GLM-5.2还有一个更高的Max等级,我们没用过)。

你可以自己深入研究这两段游戏:

花了多长时间,花费了多少

Opus 4.8 用 Claude 代码构建;GLM-5.2 在 Pi 上基于 OpenRouter 构建。

并排延时摄影。Opus在34分00秒结束,GLM-5.2在1分11秒结束。

延时摄影显示了整个构建的压缩:Opus大约用了一半的墙钟时间完成,GLM-5.2的刷取时间更长,但花费远低于预期。完整数据见顶部的结果表。

两款游戏的游戏测试

我们从头到尾都玩了两款游戏。以下是每款游戏的表现。

两者都打造了类似的游戏:一款第三人称3D平台跳跃游戏,操作方式相同。你用WASD或方向键移动,跳跃用空格键,用Shift键冲刺,通过拖动鼠标绕摄像机旋转,方向盘则可变放。

目标也是一样的:在平台收集金币,到达旗帜,避开尖刺陷阱,从世界坠落则回到起点。

GLM-5.2

GLM-5.2的游戏看起来有点粗糙。根据游戏流程:

  • 整体看起来并不理想。
  • 角色缺少了一些材料。
  • 尖刺危险不会杀死角色。
  • 到达旗帜也没用。没有胜利条件。

注释

更新:胜利条件确实有效。它要求先收集所有金币,标志才会触发。原版游戏缺少这一点。

所以其实也没那么好。不过它确实说中了一件事:弹簧。

GLM-5.2春季发射。

你可以跳上弹簧,然后跳到下一个平台。

作品

Opus的游戏更简洁,操作也流畅。以下是游戏体验:

  • 摄像机和控制器都能正常工作。
  • 尖刺危险会杀死玩家,所以这个逻辑是正确的。但它位于关卡侧面,而不是路径上,所以你得特意绕路才能击中它。
  • 整体看起来不错,你能到达旗帜并获胜。这里有真正的胜利条件。

动画看起来不错,运行流畅,纹理应用得当。

Opus:动画、贴图、手柄工作。

每个模型如何检查自己的工作

两款模型都被告知在停止前要核实工作。一个常见的做法是截屏成品并查看,确认没有损坏或缺失。这正是Opus在会议中所做的。

GLM-5.2 在这里遇到了问题,因为它无法读取图像。它不是多模态的。所以它没有看截图,而是采用了一个简陋的变通方法:写脚本读取原始像素数据,检查颜色是否大致符合预期。

为什么GLM-5.2的自我检查漏掉了这些漏洞

由于无法看到已保存的截图,GLM-5.2 尝试通过读取像素来验证帧数。以下是其最终报告中的一段摘录,内容是通过采样颜色“分析”已保存图像:

final_start/overview/flag.png颜色分析:草绿、泥棕、金币、旗红色、角色蓝色、半兰伯特灯,无黑色

它预期的颜色都在那里,所以确认游戏已经结束并停止了。但正如你在下面最后截图中看到的,角色是平面灰色,纹理缺失,调试叠加层仍然悬挂在场景上。

一个能看截图的代理很可能会发现两者,并回去修复它们。

GLM-5.2的最终截图:角色纹理缺失,调试覆盖层依然开启。它从未看到帧。

在有视觉效果的任务中,能够理解图像会让模型比不能理解的模型更具优势。

Opus如何检查其工作

Opus是多模态的,所以它可以直接读取截图。它的束缚器渲染了游戏并捕捉了帧,Opus在验证时检查了那张图片。以下是摘录会议描述了它所看到的情况:

最终场景渲染正确:草地方块配棕色泥土侧面,楼梯攀爬,金银硬币和宝石,右岛上的蓝色尖刺方块障碍,顶端球门的红旗,角色站在起始广场,以及比分HUD。光照和阴影正确,几何体干净利落。

Opus的截图:干净的HUD,调试显示被移除。

因为能看到画面,Opus注意到屏幕上留下的调试显示,并在完成前清除了它们。

虫子

两款游戏都有漏洞。以下是各自的故障。

GLM-5.2

GLM-5.2的bug频繁且明显,其中几个是基础问题。

角色面向错误的方向。它朝着正确的方向走,但模型始终是反着的。

缺少纹理和消失的头部。角色渲染的是平面灰色而非纹理,且当摄像机移动时,角色的头部会消失。Kenney模型指向一个共享调色板,而不是嵌入文件,GLM-5.2的渲染器从未加载该文件,因此又回到了平面颜色。

Opus加载了调色板,因此角色呈现出纹理。

死亡激增不会致命。角色正好落在尖刺危险处,什么都没发生。没有死亡,没有重置。

作品

Opus更少且更为微妙,是边缘案例而非破碎的基础。

站在空气中。角色可以坐在平台旁,悬空而不会坠落。这是它的“郊狼时间宽限期”,即你刚从边缘跳跃的短暂窗口,调校得稍显宽松。这是一个稍显过度的打磨功能,而非破坏基本功。

从太远的距离赢得胜利。胜利触发时,角色还远未达到旗帜。

测试结果

两款模型从零开始打造了一个完整的运行3D平台游戏,没有引擎和3D库,一次过完成。这是个很高的标准,不久前两者都无法达到。以下是它们的分工方式。

GLM-5.2:速度慢、粗糙、便宜

GLM-5.2耗时超过两倍,发布的游戏质量很粗糙:一个灰色无纹理的角色,一个无法杀死人的尖刺,最后屏幕上还显示着调试叠加层。它的大部分漏洞都是基本问题。

成本只有五分之一。

Opus:更快、更干净、更贵

Opus只用了一半的时间,发布了更干净、更准确的游戏。它的bug是边缘案例,不是破碎的基本问题。价格大约是它的四倍。

多模态优势

Opus可以读取图像,因此其自我检查会查看渲染后的游戏并发现视觉问题。GLM-5.2是纯文本版本:通过数字验证,从未发现角色是灰色的,也没发现调试覆盖层还在。

在视觉任务中,这就是捕捉粗糙边缘和发布的区别。

一场比赛就是一个数据点。下面的基准测试的都是同样类型的大规模能力。

基准测试

Z.ai在发布时发布了这些基准数据,在其型号卡.每行中最佳结果为粗体.

*=人为自报.

基准测试GLM-5.2作品4.8GPT-5.5双子座3.1 Pro
推理
HLE40.549.8*41.4*45
高强度教育(带工具)54.757.9*52.2*51.4*
爱 202699.295.798.398.2
GPQA-钻石91.293.693.694.3
依我看,安斯沃尔Bench91.083.5–81
编码
SWE-bench Pro62.169.258.654.2
NL2仓库48.969.750.733.4
DeepSWE46.2587010
ProgramBench63.771.970.839.5
终端工作台2.1(终点站-2)81.0858474
终端工作台2.1(最佳背带)82.778.983.470.7
SWE马拉松13.026.012.04.0
能动性
MCP-Atlas(公开)76.877.875.369.2
工具十项全能48.259.955.648.8

独立运营人工分析大致同意:

  • 智力指数v4.1:51(领先的开放重量级;MiniMax-M3 44,DeepSeek V4 Pro 44,Kimi K2.6 43)。
  • TerminalBench v2.1:78%(相比型号卡上的81 / 82.7——不同的线束)。
  • 每个任务输出令牌数:~43k(GLM-5.1:26k)。

数据与我们的测试相符:GLM-5.2在开权重组中领先,推理上互有攻势,但Opus仍占据大部分编码和代理行。

每个基准衡量的内容

这些基准测试涵盖三个领域。以下是每个基准测试的内容,按表格的分组方式排列。

推理困难的数学和科学考试:

  • HLE.人类的最后考试。数千道专家级题目,涵盖多个学科,设计得极其困难。“使用工具”这一行是同一份考试,允许网页搜索和代码。
  • 爱 2026.一场艰难的美国高中数学竞赛。
  • GPQA-钻石.研究生水平的科学问题写成了无法快速搜索就能回答的。
  • 依我看,安斯沃尔Bench.数学奥林匹克式题目,最终答案得分。

编码修复漏洞并构建完整项目:

  • SWE-bench Pro.修复真实代码库中的真实问题,通常会跨多个文件进行修改。
  • NL2仓库.从单一规范构建一个完整、可运行的代码库。
  • DeepSWE.在没有互联网的沙箱容器中完成代理软件工程任务。
  • ProgramBench.仅从编译后的二进制文件和文档重建完整程序,且不提供来源或规范。
  • 终端工作台 2.1.任务通过真实终端完成。两排使用固定线束(Terminus-2)和各型号最佳线束。
  • SWE马拉松.二十项超长距离工程任务,每项工作持续数小时。

能动性调用并串联真实工具:

  • MCP-阿特拉斯.工具使用任务运行在真实的MCP服务器上,每个任务都需要多次工具调用。
  • 工具十项全能.跨越许多真实应用的长期任务,每个都需要长链工具调用。

人们说的

基准测试和我们自己的测试是一回事;网络上的反应则是另一回事。很多都是没有业绩记录的账号炒作,所以我们选择了那些判断经得起时间考验的人和团体。

Simon Willison:“可能是最强大的纯文本开放权重LLM”

多年来,西蒙·威利森几乎为所有著名模型发布撰写了文章。他称为GLM-5.2“可能是最强大的纯文本开放权重LLM。”

他的标准测试是请模型制作一只鹈鹕骑自行车的SVG。GLM-5.2返回了一个完整动画且无损坏的SVG,他称之为“非常令人印象深刻”。

第二个测试是一只骑踏板车的负鼠,结果比GLM-5.1之前做的版本还要差。所以它很强,但并不均匀。

人工分析:顶级开放模型,但极度依赖代币

Artificial Analysis,一个独立的基准测试组织,排名GLM-5.2这是其智能指数中领先的开放权重模型。它得分为51,领先于MiniMax-M3、DeepSeek V4 Pro和Kimi K2.6,并且在成本与智能的竞争中处于同级别最便宜的模型。

@ArtificialAnlys 在 X 上

他们标记了我们遇到的同样问题:它对token需求很高。它每个任务大约用4.3万个输出token,其中大部分是推理的,比他们测量过的任何领先的开放模型都多。

内森·兰伯特:开闭差距正在缩小

Nathan Lambert 在艾伦人工智能研究所追踪无权级模型。观察 GLM-5.2 在 LMArena 排行榜上的排名,他有人辩称“你可以说他们有比Gemini更好的代理”,并称这是MIT授权的开放模式“一项重大成就”。

@natolambert 在 X 上

他更广泛的观点是,中国实验室在更少的计算量下达到了这些分数,即使顶级美国型号整体仍领先,也不应被忽视。这与我们的测试一致,Opus领先,但GLM-5.2的价格和开放性显示的更接近。

判决

那么,炒作是真的吗?大部分是。

GLM-5.2 是一款真正强大的开放模型,价格仅为 Opus 的一小部分。对于大量工作来说,这种组合很难被超越。但它不是 Opus。在我们的测试中,Opus 更快,发布的游戏更干净、更准确,并且可以通过观察来验证自己的工作。

GLM-5.2 价格低得多,但更粗糙,而且它只有文本。

当成本和开放性重要,且工作主要是文字和逻辑时,使用GLM-5.2。当正确性、精致和视觉判断重要时,使用Opus,你会为此付出代价。无论如何,GLM-5.2都应保留在武器库中:它是罕见的与边疆相关型号,任何厂商都无法夺走。

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论