那个教 ChatGPT 说话的人,做了一个「哑巴」模型
作者|桦林舞王
编辑|靖宇
AI 圈子里最懂怎么让模型「开口聊天」的人,现在决定剥夺大模型的语言能力。
这位前 OpenAI 研究员、ChatGPT 的共同发明者 Diogo Almeida,在潜行两年后带着他的新公司 TypeSafe AI 和 4000 万美元融资回到牌桌。他们发布的全新模型 Jev, 既不能写打工人的周报,也不能陪用户深夜长聊。它甚至连一个标点符号都吐不出来 。

TypeSafe 创始人 Diogo Almeida|图片来源:X
这是一个反常识的时刻。过去三年,全行业都在教大模型怎么学会像人类一样「慢思考」,各家实验室拼命拉长推理链条,让模型在给出答案前默默自言自语几千个词。
但 Jev 走了一条完全相反的路: 它不做文本生成,只输出确定性的结构化决策。
这不仅是一个新产品的发布,更像是对当前大模型技术范式的一次公然叫板。
01
给 AI 装上「反射神经」
要理解 Jev 到底是个什么东西,得先看懂当下的 AI 开发者有多痛苦。
如今大部分工程师把大模型接入业务系统时,做的事情往往很荒谬。你明明只需要它回答「这封邮件是不是垃圾邮件」或者「在五个 API 接口里选一个」,但你不得不让一个拥有上千亿参数的庞然大物,在漫长的几秒钟里,一个词一个词地把一串 JSON 字符敲出来。
为了保证这串字符符合代码规范,开发者得写满整整两页提示词,求着模型「不要输出任何废话,只要纯 JSON 格式」。即便如此,模型偶尔还是会在前后加上一句「好的,这是你要的格式」,瞬间搞崩下游的整条流水线。
Jev 解决问题的方式极其粗暴。 它根本就不是一个文本自回归模型 。

速度对比,3 秒时间 Jev 这边已经腹泻版吐出 Token(左)|图片来源:TypeSafe
在 Kahneman 著名的《思考,快与慢》中,人类的思维被分为两个系统。系统一是无意识的、极速的本能直觉;系统二是缓慢的、需要调动精力的逻辑推理。当下的主流大模型都在拼命卷系统二,而 Jev 给自己的定义是世界上第一个纯粹的「系统一模型」(System One Model)。
它不逐字生成内容,所有决策都在一次单向并行计算中同时产出。这意味着它没有生成式的废话,输出永远严格锁定在开发者预先定义的 Schema 里。
在数学层面上,Jev 彻底消灭了结构化输出的格式幻觉。
由于不需要一步步推演下一个 token 是什么,它的端到端延迟直接被压缩到了 70 到 500 毫秒之间,比目前市面上的前沿大模型快了 40 到 200 倍。

Jev 打 Doom 游戏测试|图片来源:TypeSafe
TypeSafe 甚至拿 Jev 去玩射击游戏 Doom。在不需要做复杂长线规划、只需要每秒钟做出约 10 次即时操作判断的场景下,Jev 表现得像一个反应极快的人类玩家,而整套推理成本每小时大概只要 7 美元。
更夸张的是价格。Jev 的输入成本是每 100 万 token 仅需 0.042 美元,输出则完全免费。 平均算下来,单次结构化决策的成本大约是 0.0004 美元。作为对比,调用一次 GPT-5.6 Terra 的费用大概是它的 76 倍,而 Claude Opus 5 则是它的数百倍 。
输入非结构化数据,瞬间吐出带有校准概率的分类选择、数值评分或布尔判断,然后立刻交出控制权。这就是 Jev 的全部工作。
02
Agent 的瓶颈不是脑子太慢
为什么 TypeSafe 会选择在这个时间点,做一个完全不吐字的模型?
答案藏在正在全面铺开的 AI Agent 里。
无论是 Cursor、GitHub Copilot 还是硅谷各种企业级自动化工作流,工程师们很快发现了一个残酷的现实:现在的 Agent 之所以又卡又贵,往往不是因为核心逻辑不够聪明,而是因为中间的「执行摩擦」太大了。
一个完整的 Agent 任务通常包含几十个微小的决定。比如判断当前步骤是否成功、决定调用工具 A 还是工具 B、提取上一段输出里的关键字段、判断要不要终止流程。
如果每一个微小动作都要去调用一次千亿参数的超级大模型,不仅延迟会层层累加到几十秒甚至几分钟,成本也会迅速失控。更要命的是,只要其中任何一步的 JSON 格式解析失败,整个 Agent 就会直接卡死在半路上。

工作流平均准确率和成本对比|图片来源:TypeSafe
行业被自回归文本模型绑架得太久了,以至于大家几乎默认了所有 AI 任务都必须通过自然语言去中转。
但现实世界里的生产系统,绝大多数节点本质上只是传统的代码控制流。代码不需要情绪价值,代码不需要排比句,代码只需要一个极度廉价、极其迅速、绝对符合类型的决策信号。
Jev 的出现, 其实是在大模型的系统架构里插进了一层「前置反射弧 」。
在理想的协同架构里,那些昂贵的前沿大模型应该退居幕后,充当统领全局的系统二,负责宏观规划和高难度思考。而在第一线负责处理脏活累活的,比如工单分类、内容合规初筛、大批量数据打标、乃至在几十个 API 里精准选择调用哪一个,完全可以交给 Jev 这样的系统一模型去毫秒级搞定。
TypeSafe 给出的自有测试数据显示,在四个典型的企业工作流中,Jev 的准确率达到了 67.8%,几乎打平了 GPT-5.6 Terra 的 67.9%。如果只看判断的精准度,它并没有输给比它贵数十倍的大模型,而执行速度却拉开了几十倍的差距。
把大脑皮层的慢思考与脊髓的条件反射拆开,这或许才是 AI Agent 能真正跑进大规模工业化落地的正确姿势。
03
0 误差背后的黑盒
不过,如果把 Jev 看作一颗完美的银弹,显然过早了。在这份惊艳的技术答卷背面,至少有两块巨大的阴影被刻意回避了。
首先是可解释性的全面丧失。
传统的思维链模型虽然啰嗦且容易出错,但它至少会把「为什么这么选」的过程写在草稿纸上。当一个信贷审核 Agent 拒绝了客户的申请,或者安全系统拦截了一笔交易,合规部门可以通过推理过程去追溯模型的决策逻辑。
而 Jev 的输出只有干瘪的选项和概率,它根本不具备用自然语言阐述理由的能力。当模型做出一个关键误判时,没有任何人能从它黑盒般的权重里找出原因。在金融、医疗、法律这些强监管领域,这种缺乏审计能力的决策机制,往往会直接撞上合规的南墙。
其次是技术细节与评估基准的封闭。
TypeSafe 宣称他们发明了一种名为 RLCD(基于校准决策的强化学习)的全新训练方法,取代了传统的 RLHF。但从目前公开的信息来看,具体的奖励函数怎么设计、网络架构到底基于什么、校准概率的数学方法论究竟为何,官方全都没有披露。
更微妙的是那些漂亮的分数。目前所有的基准测试全部来自 TypeSafe 内部评估,没有任何第三方独立机构完成过复现。他们用来作为真值标准的参考答案,甚至是由 GPT-6 Astra 和 Claude Fable 5.1 跑出来取平均值得到的。 用竞争对手的下一代模型来当裁判,再宣布自己在性价比上大获全胜,这种自证闭环本身就带着强烈的公关色彩。
更不用说商业模式的可持续性。每 100 万 token 仅收 4 美分,且输出完全免费,这种价格低到了让人怀疑是在烧 4000 万美元融资打价格战。
目前 Jev 依然处于小范围邀请内测阶段,当大量高并发的真实企业级流量涌入时,这套体系能否在保持超低延迟的同时维持收支平衡,还要画上一个问号。
把模型做小、做快、做确定,确实击中了当下的行业痛点。但在没有真正接受真实业务环境里极端情况的拷打之前,断言它已经颠覆了范式,还为时尚早。
过去几年,所有人都在惊叹于 AI 越来越会说漂亮话。而现在终于有人意识到,在沉默的机器世界里,行动往往比语言更重要。
*头图来源:TypeSafe
本文为极客公园原创文章,转载请联系极客君微信 geekparkGO