在RTX 3090上对Qwen 3.6 35B MoE(3B活跃)进行基准测试

我在群聊里提到我买了第二台RTX 3090,一个朋友说:
我知道这不是你的菜......但请告诉我它运行得有多快 Qwen 3.6 350亿 MoE。只有24GB显存,你需要用4位量化显存 版本不同,你不会看到巨大的上下文窗口。但应该还是 挺酷的。
他说得对,这其实并不是我的风格——我一直在专注于我的 最近拥有了LLM。我决定深入挖掘,特别是玩玩Llama.cpp,我已经有一阵子没用了。然后事情变得 有点失控,我最终做了一些相对详细的基准测试。
标题结果是:我下载了Unsloth对模型的UD IQ4_NL_XL量化 来自拥抱脸.说到这里, 使用默认的Arch Llama.cpp版本,底层搭载Vulkan:
仅用GPU时,我能让模型生成速度刚好超过120个令牌每秒, 而且它能以略低于2800 tok/s的速度处理提示。然而, 整个模型放在GPU上,上下文空间不大 窗口——它被限制在大约50,000个代币,相比模型的 本地语境长度为262,144。
将模型40层中前12层的FFN卸载给CPU后,成功回收了 足够多的显存以获得完整的上下文长度;然而,按照这样的设定, 事情——毫不意外地——变得更慢了。我生成的 tok/s 刚好超过 65, 提示音为600 Tok/s。
我自己整理Llama.cpp,获得完整的CUDA版本,帮助很大:
所有设备都装在显卡上,我生成时输出为140 tok/s,超过3300 tok/s 关于提示。这是在89,600个上下文窗口下进行的。所以一切都是 更好了:-)
而且更容易获得完整的上下文长度;只需10层FFN即可 卸载后,那时我的生成速度是89 tok/s,大约1100 感谢这个提示。
这确实是个相当令人印象深刻的进步。
但这也显示出缺少显存......
评论
?
参与讨论