GLM-5.2:可能是最强的纯文本开源大模型

中国AI实验室Z.ai于6月13日向其“编码计划”订阅用户发布了GLM-5.2版本, 并于昨日(6月16日)以MIT许可证公开了完整的权重文件。 该模型的规模与此前发布的GLM-5和GLM-5.1相当,参数量高达7530亿个——足足1.51TB的庞然大物, 且拥有40个活跃参数(专家混合模型)。 GLM-5.2是一款仅支持文本输入的模型。 Z.ai最近还推出了一套独立的视觉模型系列,其中最引人注目的是GLM-5V-Turbo; 不过,该模型并未公开权重。GLM-5.2的上下文窗口长度为100万token, 而GLM-5.1的上下文窗口长度为20万。

这款模型的热度非常高。

Artificial Analysis公司运营着一项备受推崇的独立基准测试:GLM-5.2已成为人工智能分析指数中领先的开源权重模型。

在Intelligence Index v4.1榜单中,GLM-5.2位居榜首,其得分高达51分,领先MiniMax-M3(44分)、 DeepSeek V4 Pro(最高44分)以及Kimi K2.6(43分)。

然而,他们也发现该模型在处理大量token时表现得相当“耗能”:

GLM-5.2每项任务的输出token数量高于其他领先的开源权重模型:在Intelligence Index任务中,该模型每项任务可使用4.3万个输出token,相比GLM-5.1(2.6万个)以及MiniMax-M3(2.4万个)、 Kimi K2.6(3.5万个)和DeepSeek V4 Pro(最高3.7万个)都更高。

此外,该模型目前在Code Arena WebDev排行榜中位列第二,仅次于Claude Fable 5。该排行榜主要衡量“前端Web开发任务,包括代理式编码工作流”。 令人印象深刻的是,尽管该模型缺乏图像输入——而我曾错误地以为图像输入是打造真正优秀的前端编码模型的关键要素之一——它却能取得如此优异的成绩。

我已通过OpenRouter试用了该模型,OpenRouter从9家不同的供应商处获取了该模型, 其中几乎所有的供应商都对输入收取1.40美元/百万token,对输出收取4.40美元/百万token。 作为对比,GPT-5.5的收费为5美元/30美元,而Claude Opus 4.5–4.8的收费则为5美元/25美元。

出色的鹈鹕,令人失望的负鼠

GLM-5.1曾让我收获了我最喜欢的鹈鹕之一, 以及我一生中最钟爱的负鼠(“生成一张北弗吉尼亚州负鼠骑着电动滑板车的SVG图”这一提示词)。 有趣的是,在这两种情况下,模型都选择将SVG嵌入到HTML文档中,并利用CSS添加了额外的动画效果。

现在让我们来试试GLM-5.2。对于“生成一张鹈鹕骑着自行车的SVG图”这一任务, 我得到了以下结果:这个结果:

这是一幅自包含、完全动画化的SVG,而且动画效果丝毫没有出现任何问题! 通常,我常常会看到眼睛脱落,或者车轮独立于自行车旋转,但这一次,一切运行得非常顺畅。 这幅矢量插画中,鹈鹕的形象也十分生动,令人赞叹不已。

遗憾的是,“北弗吉尼亚州负鼠骑着电动滑板车”这一任务的表现远不如前一次。结果却差强人意:

与GLM-5.1相比,这次的表现简直天壤之别!提醒一下,那只负鼠原本是这样的:

而5.2甚至没有尝试为其添加任何动画效果。

标签:ai, generative-ai, llms, pelican-riding-a-bicycle, llm-release, openrouter, ai-in-china, glm

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论