SWE-Serve:面向生产推理服务的智能体工程基准测试
NVIDIA Research 发布 SWE-Serve 基准,将 SGLang 真实推理系统工程工作(模型集成、API、缓存、GPU kernel)转成 53 个可验证编码任务,用 11 个模型 × 31 种配置各跑 3 轮。 榜首 Claude Opus 5 与 Claude Sonnet 5 Pass@1 均为 75%,前者成本 $17/配置,后者 $12;DeepSeek V4 Flash、GLM-5.2 等多数模型在 46–64% 区间。 文章重点不是模型排名本身,而是把"agent 能否完成生产级推理系统工程"作为可量化指标:每个任务都有功能测试 + 回归测试双重验证,agent 闭卷(禁公网、禁上游仓库),仅给任务说明和起始仓库,评分只看 verifier 结果而非代码匹配参考解。 对关注 AI 编程 agent 工程能力、推理系统(SGLang/vLLM 类框架)以及"模型能写生产级系统代码吗"这一争论的科技读者,有明确讨论入口:不同模型的成本-通过率权衡、闭卷条件下 75% vs 35% 的巨大差距、以及"通过验证器 ≠ 代码可合并"的局限。


