Quesma Blog

RSS: https://quesma.com/rss.xml
面向前沿实验室与企业的 AI 独立评估与培训。

Claude Code 定价:同模型同 token,价格差高达 40 倍

Claude Code 按 token 计费比订阅贵 40 倍,Uber 四个月烧光全年 AI 预算。Pylon CEO 三天花掉 $4,000。SemiAnalysis 实测 Max 20x 订阅对应 $8,000 API 等价费用。Anthropic 订阅只占收入 5-15%,企业按量计费才是利润来源。
评论点赞收藏5 天前

把4个Claude模型接进Claude Code,在Terminal-Bench上翻车了四次

用4个Claude模型搭了多智能体编排系统跑Terminal-Bench 2.1,78%正确率排第七,花了$1,178,暴露四个问题。委托机制让Opus 5拒绝执行合法安全任务,直接问能解、委托就不解。验证步骤设为可选导致25%任务跳过审查,正确率从91%暴跌到43%。最贵的Opus 5被放在最高频的执行角色,占58%花费,角色分配反了。超过6次交接后成功率从90%跌到50%,花费翻近四倍。
评论点赞收藏5 天前

量化对知识的损害是非线性的——Qwen3.6 27B 案例研究

量化会非线性地损害模型知识。对 Qwen3.6 27B 的 55 种量化版本测试发现,4-bit 量化后事实知识几乎无损,但 3-bit 以下知识骤降——比单纯缩小模型参数更严重。原因是量化是"盲压缩",只逼近原始分布而非优化训练数据,KL 散度与知识损失呈线性关系。实际建议:8-bit 最安全,4-bit 通常够用,优先用能放进显存的最大模型而非更小更便宜的模型。
评论点赞收藏12 天前

Qwen 3.6 27B 量化会破坏鹈鹕吗?

Qwen3.6 27B 量化模型在 4-bit 及以上精度下质量几乎无损,2-bit 开始明显退化。作者通过 SVG 生成、数学基准和概率分布测试验证了该结论。
评论点赞收藏19 天前

Tokenflation:当“你好”触发33次工具调用

简单任务消耗过多上下文和工具调用,却未增加有用输出。测试发现某模型仅回复“Hi”就触发了33次工具调用并擅自提交代码。这一现象揭示了当前大模型在工具使用上的过度倾向和资源浪费问题,对优化API成本和提升系统效率具有直接参考价值。
评论点赞收藏38 天前

对 AI Agent 说“嗨”的真实代价

Token 价格下降不代表 AI Agent 变便宜了。模糊的 Prompt(如简单的 "Hi")会导致 Agent 反复试错,消耗大量计算资源,最终烧掉的是开发者的薪资预算。文章揭示了“简单问候”背后的隐性算力成本,提醒工程师在构建 Agent 时需重视 Prompt 的精确性,避免因指令不清导致昂贵的无效推理。
评论点赞收藏38 天前

比较编排层而非模型:Blitzy 与 GPT-5.4 在 SWE-Bench Pro 上的对决

Quesma 独立审计了 Blitzy 在 SWE-Bench Pro 基准测试中取得的 66.5% 高分,确认其成绩有效且高于 GPT-5.4。文章指出,在企业级复杂代码库场景中,智能体编排层(Harness)的工程能力比单纯依赖大模型底座更为关键。 Blitzy 通过深度分析仓库、生成详细规范及严格验证,解决了模型在“最后一公里”执行细节上的失误。这表明未来 AI 编程的竞争焦点将从模型本身转向围绕模型的工程基础设施。
评论点赞收藏129 天前

我们在二进制文件中隐藏后门,让 AI 去查找

发布 BinaryAudit 基准测试,在约 40MB 的真实开源服务器和代理二进制文件中隐藏后门。 测试 AI 智能体结合 Ghidra 发现这些后门的能力,直接检验当前 AI 在二进制安全和漏洞挖掘方面的真实水平,具有强烈的技术验证色彩。
评论点赞收藏174 天前

BinaryAudit:AI能在机器码中发现后门吗?

Quesma团队测试了多款主流大模型在逆向工程工具辅助下,从编译后的二进制文件中检测恶意后门的能力。结果显示目前最高准确率仅约50%,且存在误报问题。 该基准测试涵盖了DNS服务器、SSH等多种真实网络基础设施软件,并开源了数据集和评估框架,旨在推动AI在代码安全审计领域的进步。
评论点赞收藏183 天前

使用 Claude、Ghidra 和 MCP 逆向《River Raid》

利用 Claude 通过 MCP 协议连接 Ghidra,对经典游戏《River Raid》进行逆向工程。 这是一次测试 AI 智能体处理 6502 汇编语言、内存映射及 80 年代游戏逻辑能力的实战实验,展示了 AI 在底层二进制分析中的潜力与局限。
评论点赞收藏194 天前

OpenTelemetry 基准测试:AI 能追踪你的失败登录吗?

测试 14 种 AI 模型在 11 种编程语言中使用 OpenTelemetry 进行代码插桩的能力。 结果显示即使是表现最好的模型也难以准确生成符合主流开源标准的追踪代码,揭示了当前 AI 在复杂工程规范落地方面的短板。
评论点赞收藏198 天前

OTelBench:AI能搞定OpenTelemetry自动埋点吗?

Quesma团队发布OTelBench基准测试,评估主流大模型在分布式追踪和OpenTelemetry代码注入方面的能力。 测试涵盖C++、Go、Java等11种语言,结果显示目前AI无法完全自动化处理复杂的微服务可观测性任务, 最高通过率仅29%。 文章详细对比了Claude Opus 4.5、GPT-5.2等模型的准确率、成本与耗时,并绘制了帕累托前沿图。数据表明,尽管模型在进步,但在处理上下文传播等复杂场景时仍面临巨大挑战,且不同语言的支持程度差异显著。
评论点赞收藏201 天前

Vibe coding needs Git blame

Prompts are specs, not code. This influences git workflows for vibe coding: tracking LLM prompts in GitHub repositories, managing commit messages, and debugging non-deterministic AI outputs.
评论点赞收藏217 天前

Prompt 不是新的源代码

文章探讨了在“氛围编程”时代,Prompt 是否应被视为新的源代码。作者认为 Prompt 具有概率性且缺乏长期支持,不应作为构建输入,而应作为开发意图的记录。 作者建议将 Prompt 视为规范,主张在 Git 中追踪和归因 AI 贡献,以便进行意图验证和高效代码审查,同时承认了隐私和创作习惯带来的保留意见。
评论点赞收藏218 天前

2025年:AI从花哨演示走向生产工具

作者回顾2025年AI从实验到生产工具的转变。重点分析了推理模型、智能体编码和开源模型的进展,指出早期工具因速度慢或不可靠难以落地。 目前主流模型已实现高效、低成本且稳定的日常使用,如Claude Code和Deep Research成为开发者标配,标志着AI真正进入实用阶段。
评论点赞收藏224 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。