斯坦福和Nvidia的类Jev开源模型
斯坦福与Nvidia联合发布CLM-8B,一种用于agent有界决策(工具选择、输出排序、分类)的对比式语言模型。核心思路:不逐token生成,而是将当前状态与候选动作编码到共享embedding空间,选最匹配项。 架构用Qwen3-8B做冻结backbone,分别训练state/action投影头;因动作可预先编码并缓存,推理最高比TypeSafe的Jev快9倍,且在两个游戏任务上成功率持平,工具调用Benchmark(BFCL v4)95.2% vs 99.2%,WikiRacing 26/30 vs 30/30。 训练三阶段:6000万问答对、3000万硬负样本、100万agent轨迹。零样本测试中,编码任务里用Opus 5生成候选后由CLM排序,DeepSWE 81.6%、Terminal-Bench 2.1 87.6%,均超Jev对应71.1%和83.1%,延迟低4.1–5.7倍。 权重以Apache 2.0开源,含微调工具、TypeSafe兼容API和交互playground。团队计划10月初发布多模态CLM-35B-A3B。核心卖点:降低多步agent链式决策的累积延迟,适应"动作集固定、状态频繁变化"的企业场景;限制:不擅长开放式推理,只能对已有候选做相对排序。 



