GLM 5.2 玩文本冒险游戏
我听说关于新的GLM 5.2开放权重模型的口碑不错。据说它能力非常强大! 我不会进行完整的基准测试,不过我在OpenRouter上有一些积分在流转, 所以我想把GLM 5.2与同价位的Gemini 3 Flash进行对比,看看它们的表现如何。
本次测试采用与之前基准测试相同的设置:每款LLM都会尝试玩几局游戏,每局游戏的预算固定为大约0.15美元。 LLM并不知情,但该追踪系统会记录每局游戏的成就,并统计LLM在每局游戏中获得的分数。
以下是本次运行中每局游戏的尝试次数。
评论
?
参与讨论