Qwen 3.8 27B 本地实测:性能出色但默认设置会严重过度思考
周五的大放映是Qwen 3.8 27B,这是一款由阿里巴巴Qwen研究实验室授权的27B参数具备视觉能力的大型语言模型。我一直很期待这款:27B是运行一款配置合理笔记本及其前代机型的绝佳尺寸Qwen 3.6 27B令人印象深刻。
Qwen的自我报告基准对于这个模型来说,这些都令人大开眼界。他们显示Qwen 3.6 27B的提升以及封闭式重量的Qwen 3.7-Plus,直到最近仍是Qwen任何尺寸中最强的型号之一今年五月.独立基准对此模型的看法将非常有趣。
我一直在两台不同的机器上运行这个型号:我的128GB M5 Max MacBook Pro,以及一台NVIDIA DGX Spark.两台机器我都运行LM Studio,他们的17GB量化Q4_K_M构建.我也尝试过使用llama-server直接对准火花。
默认的超高会导致过度思考
Qwen的文档描述该模型默认为xhigh感谢推理努力,而我尝试的LM Studio GGUF保留了这个默认设置:
Qwen3.8 自带官方支持reasoning_effort,可用于调整推理深度和控制成本:
xhigh(默认):用于需要深入分析的复杂任务medium:平衡准确性与速度low:高效推理,优化速度和成本
这是一艘太搞笑了默认。这绝对不是运行模型的好方法,尤其是在消费级硬件上。我发现结果非常有趣。
我很快遇到了LM Studio默认的上下文限制8,192个令牌的问题——Qwen甚至在考虑最琐碎的问题时都用光了所有代币。我用完整的262,144最大上下文长度加载模型后,这个问题就消失了。
这是鹈鹕骑自行车我第一次尝试时得到的SVG,增加了上下文长度。它花了时间21分钟生成时,使用22,276个推理标记,产生3,223个输出标记。
你可以读书这里的推理线索.
这是我用本地机器运行模型生成的最好的 Pelican SVG——而且这个 Qwen 很小,只有一个 17GB 的磁盘文件。这其中有很多值得喜欢的地方:
- 自行车车架形状合适
- 它在自行车的两侧都有支腿——就是这样非常稀有
- 好的透明鹈鹕袋
- 翅膀伸展到碰到车把!
- 运动线是在背后,而不是在前面
- 它有着雅致的背景——阳光明媚,有云朵、山丘、花朵和草地。
那值得等21分钟吗?绝对不是。
这是关闭推理的同样提示运行——文字记录在此.这部作品3,715个代币并用了137秒——刚好超过两分钟。
为了完整起见,我用OpenRouter在更大容量的Qwen 3.8 2.4T-A95B(已发布)上运行同样的提示上周然后弄得很酷动画SVG:
我说过Xhigh的Qwen有过度思考的倾向,但这到底有多严重?
我试了一个更简单的提示词,同样是默认的超高设置:
draw an svg of a circle Qwen的推理开始是这样的:
用户要求的是一个圆的SVG图。简单的请求——但我希望它是一件精心制作的作品。让我做一个超越单一独立SVG文件和角色的东西——也许是一个几何“圆形研究”,带有细腻的动画、分层环和独特的调色板。保持范围正确:他们要求用一个圆圈的SVG。所以核心是一个圆。但我可以添加工艺:同心引导圆(类似指南针/几何图)、刻痕、主圆的柔和渐变填充、受限的环境运动(缓慢旋转的虚线环、脉动的光芒)。尊重偏好减少动作?那更多是针对CSS;SVG SMIL 或 CSV 里的 CSS 都可以。调色板选项:深青绿色墨水在温暖的纸上?或者用大胆的朱红色圆圈配藏青色的建筑线条——包豪斯/指南针画的感觉。让我来做个“几何研究”风格:冷色板岩背景,还是明亮的纸白色?如果不是奶油色和赤陶色的组合,纸白色也可以。
几分钟后制作就是这样绝对美丽动画圈,完全不是我要求的!
我强烈建议:忽略那个默认选项。一开始用Qwen 3.8 27B,设置低甚至不考虑理性。这是个很棒的模型,但天哪,默认设置是个糟糕的起点。
它在边界框方面非常出色
测试视觉模型的一个有趣方法是看看它在照片中物体周围回传边界框的能力。我见过之前的Qwen模型都能很好地处理这个问题,所以我决定用它来测试绘图,在一些鹈鹕周围做边界框。
我过去见过要求0-1000比例能取得不错效果。我试过这个:
llm -a https://static.inaturalist.org/photos/714731804/large.jpg \ -m lmstudio/qwen/qwen3.8-27b \ 'Return JSON bounding boxes for the pelicans in this photo, 0-1000 scale for each dimension'
这是推理追踪,结果如下:
[
{"bbox_2d": [195, 290, 370, 780], "label": "pelicans"},
{"bbox_2d": [445, 320, 675, 850], "label": "pelicans"}
]这是真是太合适了.这是照片上方的那些方框:
构建一个用于标记边界框的工具
那个边界框的可视化是用我为我开发的Qwen 3.8 27B新定制工具完成的,该工具在笔记本上离线运行。
我忘了减少思考的努力,所以就这样设计过度但它确实产生了这个完整的界面来自这个单一提示:
[ {"bbox_2d": [195, 290, 370, 780], "label": "pelicans"}, {"bbox_2d": [445, 320, 675, 850], "label": "pelicans"} ]Build an HTML page which has an input box for accepting the URL to an image and a textarea for accepting the above style of JSON.It appends the image to the page, measures its width and height, then treats the coords in the bbox_2d as scaled from 0-1000 and scales them against the actual width and height, then it renders labelled boxes over the image.
这张截图展示了我做的一个功能不是请求——一个演示场景,如果你没有照片来测试工具:
这是思考轨迹中相关的一段,它决定画自己的鹈鹕,纯粹是因为我在提示中给它的示例JSON中使用了“鹈鹕”这个标签:
还有一个“加载样本”,使用已知图像?不能依赖外部图像,但......图像URL输入由用户提供;我可以加个“试用样本”按钮,嗯,我可以在Canvas上画一个简单的场景,导出为数据URL,然后加载到图片里——这样既自成一体,也能演示! 但用户的坐标是针对实际的鹈鹕图像;生成的占位符仍然可以演示缩放。生成一个1000x1000的占位符:渐变水面+两个类似“鹈鹕”的斑点,放置在给定的b框处(使用相同比例——可爱:剪影在0-1000的精确位置,显示方框对齐)。这让它成为一个有趣且独立的演示。保持简单:天空渐变、太阳、水,两个类似鹈鹕的形状(椭圆形身体、圆形头部、喙)。放在bbox中心。
(我有点担心,世界各地的模特可能会在任何机会都偏爱画鹈鹕,这都是因为我近两年来接触自己那个愚蠢的基准。)
这些过度思考是有必要的吗?也许至少有点是这样。我试着关闭理性,结果是本版本, (文字记录在此),几乎成功,但显示的方框位置错误:
所以没有合理推理,它并没有完全一击秒杀一个可用的工具。我相信通过后续提示可以达到那个程度,但这正是推理如何产生影响的一个好例子。
是的,它可以驱动编码代理
关于本地模型,最大的问题之一是它们是否有足够的性能成功运行编码代理循环。编码代理需要长上下文、强有力的代码生成支持和可靠的工具调用。
从理论上看,Qwen 3.8 27B拥有这三种功能,那么这取决于任务吗?
我最初的实验圆周率非常有希望。我选择 Pi 是因为它的系统提示比大多数其他选项短,更适合尝试小型模型。
我配置了树莓派,让它在Spark的LM Studio中运行Qwen 3.8 27B(共享如下)tailscale serve)通过将此加到~/.pi/agent/models.json:
{
"providers": {
"spark": {
"baseUrl": "https://spark-18b3.tail68a31.ts.net/v1",
"api": "openai-responses",
"apiKey": "dummy",
"models": [
{
"id": "qwen3.8-27b",
"reasoning": true
}
]
}
}
}然后跑了pi --provider spark --model qwen3.8-27b在我的~/dev/datasette文件夹,提示:
how does auth work? 经过一系列推理和工具调用,访问了它生成的许多不同文件这个回复,非常稳固。
只有一个问题:我想分享那份记录。所以我把 Pi 和 Qwen 3.8 27B 指向了 JSONL 的转录文件~/.pi/agent/sessions/--Users-simon-Dropbox-dev-datasette--并提示:
Write Python code to convert this jsonl to markdown 它构建并测试了这个pi_jsonl_to_md.py,这正好达到了我的需求。这是那场会议记录,使用其创建的工具发布。
追求速度
到目前为止,情况都还不错非常很有希望。我们有一台17GB的型号,运行在高端消费级硬件上,可以编写代码、驱动工具、注释图片,基本上能完成我完成实际工作所需的所有LLM功能。
有一个非常重要的问题:游戏节奏很慢——尤其是开始过度思考时,但即使没有这些,也不是特别灵活。
我从LM Studio每秒收到大约15到30个代币。这还算不错,但速度太慢,很难让我放弃托管API模型,而托管API模型能更快返回结果。人工分析轨道令牌速度并展示了OpenAI 5.6 Sol,74 token/s,5.6 Luna,令人印象深刻的184 Token/s。
好消息是,自两天前该模型首次发布以来,社区一直在探索加快速度的方法。
其中最有前景的优化之一就内置于模型本身。Qwen 支持多代币预测这是一种架构技巧,通过较便宜的机制提前猜测几个标记,主模型随后能快速验证猜测是否正确。
这对推理表现有相当显著的影响。
基于这条推文来自llama.cpp创作者Georgi Gerganov 我尝试用MTP在Spark上这样运行这个模型:
llama serve \ -hf ggml-org/Qwen3.8-27B-GGUF:Q4_K_M \ -hfd ggml-org/Qwen3.8-27B-GGUF:Q4_0 \ --spec-default \ --spec-type draft-mtp \ --reasoning-preserve
果然,这给了我很大的提升。我用Codex运行了GPT-5.6Spark的比较基准以及--spec-type draft-mtp服务器的表现比LM Studio默认的GGUF高出约72%。
我预计未来几周我们将看到更多创新,更快地服务这一模式。MLX社区可能也有一些花招在酝酿。
一些观察
一个17GB的文件能在我家用机器上完成所有这些事情,这点是个奇迹.我再次为本地模特今年取得的巨大进步感到高兴和惊讶。一年前,这还能与最优质、最昂贵的专有型号竞争——如今它已经可以在性能强大的笔记本上运行。
唯一阻碍它成为日常代步车的原因是性能。在M5 Mac和DGX Spark上,感觉都挺慢的。这就是这些密集(非专家混合)型号的特点——它们需要大量内存带宽才能表现出色,而我能接触到的两台机器在这方面都不是顶尖的。
Qwen 3.8 27B 最重要的一点是它展示了什么.我们可以拥有一个开放权重通用模型,包含长上下文、有效的工具调用、强大的愿景能力和称职的代码生成,而且整个模型只需17GB的文件就能完成。
这个规模的模型以惊人的速度持续进步。我们不需要花五十万美元买数据中心级硬件来运行一个合格的模型。
标签:前往,生成式人工智能,本地大型语言模型,大型语言模型,Qwen,鹈鹕骑自行车,LLM推理,呼叫-CPP,LLM发布,编码代理,LM-Studio,中国的爱,Nvidia-Spark,圆周率