AI Infra:Token 价格博弈策略分析

模型更新快。价格难看懂。

有的厂商把 API 降到几分钱一百万 Token。有的旗舰模型维持几十美元高价。新模型发布就降价抢用户。能力升级后反而提价。同一家厂商同时提供缓存价、批处理价、峰谷价、标准价。

如果 Token 是大模型的电,为什么不像电价一样稳定?

答案是:Token 是计量单位。用户真正买的是任务成功完成。

一百万 Token 可能生成一堆没用的文字。也可能完成价值数万元的代码修复。比如合同审查。比如药物研究。厂商按 Token 收费。真正争夺的是谁完成任务、谁控制调用入口、谁获得价值。

理解了这一点,就能看懂价格为什么同时涨又跌。

一、先纠正误区:Token 单价不代表模型贵不贵

假设有两个模型做同一项任务。

指标模型 A模型 B
每次调用成本1 元3 元
一次成功率40%90%
平均调用次数2.5 次1.1 次
完成任务的费用2.5 元3.3 元
人工检查与返工

只看单次调用,模型 A 便宜。算上失败重试和人工检查,模型 B 更省钱。

用户承担的成本有个公式:

每次成功任务成本 = (Token 费用 + 工具费用 + 重试成本 + 人工审校 + 等待损失) ÷ 任务成功率

这叫单位智能价格。

过去人们比较每百万 Token 价格。就像只看出租车每公里多少钱。不看能不能把人准时送到目的地。现在进入 Agent 阶段。同一个任务包含长上下文、内部推理、多轮工具调用。Token 数量和业务结果的关系变不稳定。

斯坦福 AI Index 有公开数据。在达到 GPT-3.5 相近能力时,模型推理成本在 2022 年 11 月到 2024 年 10 月下降超过 280 倍。这比简单比较标价更有意义。

二、定价由三股力量决定:成本地板、价值天花板、竞争闸门

模型的价格夹在三股力量中间。

成本地板:厂商最低愿意卖多少钱

一次推理需要芯片、显存、内存、网络、电力、机房。还要分摊研发、训练、运维及闲置容量。架构优化、量化、推测解码会降低单位推理成本。

成本地板不是固定数字。实时请求比离线任务贵。高峰时段比空闲时段稀缺。超低延迟比普通响应需要更多资源。厂商计算的是某类请求占用了多少稀缺容量。

举个例子。白天高峰期调用比凌晨闲时贵 30%。这就是成本差异。

价值天花板:客户最多愿意付多少钱

聊天摘要可能值几分钱。发现一处重大合同风险可能值数万元。模型能力升级后,如果能进入代码、法律、医疗环节,客户愿意支付的上限会提高。

因此新模型可能让单位计算成本下降。同时让每次成功任务的商业价值上升。一个力量拉低价格。另一个力量留下上涨空间。

比如说。一个代码 Agent 每月省工程师 20 小时。企业愿意为它多付几百元。

竞争闸门:厂商能拿走多少价值

价值很高不等于厂商可以随意定价。客户可以选择其他闭源模型。也可以选择开源模型。还可以自建推理服务。

竞争越充分,价格越接近成本地板。可替代模型越少,切换成本越高,厂商越有机会靠近价值天花板。

价格区间可以写成:

成本地板 ≤ 模型价格 ≤ 客户愿意支付的任务价值

最终靠近哪一端,取决于替代模型数量、切换成本和厂商掌握的入口。

这个三层模型解释了一个矛盾现象。同一时期通用模型大幅降价。旗舰模型仍然维持高价。甚至提价。

三、新模型发布时,四个变量同时变化

每次模型升级,都可能移动三条边界。

变量一:单位推理成本下降

模型架构更高效。硬件性价比提高。缓存命中率提升。同样数量的 Token 消耗更少资源。厂商可以降价抢市场。也可以维持标价,把成本改善转化为毛利。

变量二:可完成任务的价值上升

当成功率从 60% 升到 90%,模型角色会变化。从提供参考意见变成独立完成流程。客户购买的人工替代量扩大。价格天花板随之上升。

举例来说。之前需要人看一遍修改的代码。现在可以直接用。节省的时间值钱。

变量三:单个任务消耗的 Token 增多

更长上下文、更深推理和更多工具调用,都会增加一次任务的 Token 消耗。单价下降不等于单任务账单下降。一个 Agent 连续工作一小时,消耗量可能远高于几十轮普通聊天。

比如一个数据分析任务。可能需要 5 万 Token。而写一封邮件只要 500 Token。

变量四:替代关系被重新洗牌

新模型会把旧旗舰变成中端型号。也会让原来做不了某项任务的低价模型跨过可用门槛。价格竞争最激烈的时刻,往往发生在多个模型同时达到够用水平之后。

这四个变量共同造成了今天的 K 型价格结构。

市场层级用户购买什么竞争状态价格走向
通用低端摘要、分类、改写、简单问答模型高度可替代快速趋近成本价
中端能力稳定推理、代码辅助、常规 Agent新旧模型正面竞争价格持续承压
前沿高端高难推理、长任务、高可靠执行合格供给较少保留明显溢价
企业保障SLA、安全、数据隔离、专属容量切换成本较高按保障能力收费

同样是 Token。通用低端更像自来水。前沿高端更像专家时间。企业保障更接近保险和专线服务。三类产品使用同一个计量单位。定价逻辑已经分开。

四、厂商围绕价格,主要在玩四种游戏

游戏一:低价抢入口

模型厂商可以用接近成本的价格争取开发者、调用量和生态适配。阶段性亏损也可以接受。

一旦某个模型成为应用的默认模型,厂商得到的远不止当前 Token 收入。还能获得真实任务反馈、开发工具适配、品牌心智和未来升级机会。低价相当于购买市场入口。

这类策略适合能力已经达到够用、推理成本领先、急需扩大生态的模型。价格越低,开发者越愿意把预处理、分类、检索增强和普通 Agent 任务放上去。调用量又会反过来改善资源利用率。

游戏二:高价收能力溢价

旗舰模型瞄准其他模型完成不了的任务。或者失败代价很高的任务。这里的客户更关心成功率、稳定性和人工替代量。

假设一个代码 Agent 每月可以节省工程师 20 小时。模型费用从 200 元涨到 400 元。对企业采购决策的影响可能很小。只要节省的人力与交付周期仍然远高于费用,厂商就有提价空间。

测试这类高价能否成立,要看涨价之后单位成功任务量是否继续增长。调用量增长只能说明使用增加。结合任务成功率、客户留存和收入变化,才能判断厂商是否拥有定价权。

游戏三:把同一种 Token 拆成不同价格

算力有个特殊属性。某个时刻空下来的 GPU 容量,过后无法重新出售。很像航空座位和酒店房间。

于是厂商开始按照请求特征定价:

请求类型客户让渡什么厂商获得什么常见价格
实时优先支付更高费用可预留容量、提供低延迟溢价
标准请求接受普通排队正常调度标准价
离线 Batch接受延迟完成可填充闲置算力通常折价
缓存命中复用相同上下文减少重复计算大幅折价
峰谷价格调整使用时段平滑负载谷时低、峰时高

主流厂商的公开价格体系里已经有这些。OpenAI 的 Batch API 相比同步调用提供 50% 折扣。Prompt Caching 的缓存输入最高可节省 90%。Anthropic 同样提供 Batch 折扣。对标准速度、快速模式、缓存写入、缓存读取分别计价。DeepSeek V4 已采用峰谷价格。空闲时段价格为高峰时段的一半。

厂商调整的对象已经从模型型号扩展到时间、速度、延迟、缓存、并发和服务保障。Token 价格开始具有云计算现货市场的特征。

游戏四:前台卖结果,后台优化 Token

当模型能够稳定完成完整任务,用户就不愿继续研究输入和输出分别多少钱。更愿意按解决一个工单付费。或者按完成一次代码修改付费。或者按管理一个 Agent 席位付费。

应用厂商可以在前台收取固定任务费。后台使用路由系统进行成本控制。简单步骤交给低价小模型。关键判断交给旗舰模型。重复上下文走缓存。非实时任务进入 Batch。

这时 Token 仍然存在。但它逐渐变成应用厂商内部的成本单位。类似云服务器的 CPU 时间。终端客户看到的是任务、席位、订阅和业务结果。

五、同一张牌桌上,不同模型厂商分别在争什么

如果只看 API 价格,所有基座模型厂商似乎都在争夺同一批 Token。实际上,它们的收入来源和战略目标差异很大。

OpenAI、Anthropic 等独立模型厂商,需要从模型能力和产品服务中直接获得收入。Google、阿里和字节可以用较低的模型价格带动云计算、搜索、办公和企业服务。Meta 可以开放模型权重,用模型层的低价换取生态影响力。DeepSeek 可以凭借成本优势主动降低市场价格锚。

所以厂商计算的收益不能只看 Token 毛利:

厂商总收益 = Token 毛利 + 云资源收入 + 订阅收入 + 生态入口价值 + 未来客户锁定收益

不同厂商对这五项收益赋予的权重不同。定价策略也就不同。

OpenAI:覆盖全部价格带,争夺智能入口

OpenAI 更适合采用旗舰溢价、小模型防御、订阅捆绑的组合。

最强模型承担高端定价。低价模型承接摘要、分类和普通问答。Cache 与 Batch 吸收可复用、可延迟的任务。个人及企业订阅降低用户对单次 Token 价格的敏感度。工具、Agent 和 API 生态继续增加切换成本。

当 DeepSeek 等厂商大幅降价时,OpenAI 没有必要让所有旗舰产品同步降价。它可以用低价小模型守住通用市场。同时让旗舰模型继续收取能力溢价。

Anthropic:守住专业任务的高可靠溢价

Anthropic 的重点场景是代码、复杂知识工作、长任务和企业 Agent。它更重视任务成功率、稳定性和企业信任形成的价格空间。

其公开价格体系已经把标准速度、Fast 模式、Batch、缓存写入和缓存读取拆开计价。愿意等待的客户获得折扣。要求低延迟的客户支付溢价。企业客户还可以为安全、数据驻留、专属容量和 SLA 付费。

这套策略能否持续,取决于 Anthropic 能否在高价值任务中维持成功率差距。一旦低价模型达到相近的可靠性,原有溢价就会受到挤压。

Google:用模型价格带动云、搜索和办公生态

Google 同时拥有模型、TPU、Google Cloud、搜索和 Workspace。它可以接受较低的模型层毛利。因为客户调用模型时,还会使用云计算、存储、数据库、搜索和办公服务。

因此 Google 可以让 Flash 类模型以低价获取大规模调用。用 Pro 类模型承接复杂任务。再通过 Priority、Batch、Flex 和 Context Cache 对不同类型的算力需求分别定价。

它的优势来自交叉补贴。即使某类 Token 利润很薄,只要模型带动了更多云资源和企业订阅,整体策略仍然成立。

DeepSeek:用成本领先重设市场价格锚

DeepSeek 的主要武器是低推理成本、低公开价格、缓存优惠、峰谷定价和较低的迁移门槛。

极低价格能够让 DeepSeek 迅速进入默认路由。承接预处理、代码、RAG 和普通 Agent 任务。峰谷价格把可延迟任务移到空闲时段。缓存低价则鼓励用户把长上下文和高频调用放到同一平台。

DeepSeek 争取的也不只是当前 API 收入。行业影响力、开发者入口、模型标准和未来产品扩展空间都属于其战略收益。

它对高价厂商的压力,在于不断降低能力已经够用的市场价格。一旦客户认为低价模型可以完成任务,高价模型就必须证明自己能显著提高成功率。

阿里 Qwen 与字节豆包:模型低价,云平台回收

阿里和字节都拥有模型之外的基础设施与业务入口。

Qwen 可以通过开放权重和多尺寸模型矩阵扩大开发者覆盖。再由 Model Studio、云计算、企业部署和行业服务实现收入。阿里云已经对 Batch、Context Cache 和实时推理进行差异定价。缓存读取价格可以显著低于普通输入。

豆包则可以利用消费应用、内容流量和火山引擎扩大调用规模。低价模型进入客服、营销、内容和互联网应用后,可以继续带动企业推理、多模态服务和云资源消费。火山方舟也已经提供在线推理、批量推理和上下文缓存等不同服务形态。

这两类厂商都可以把模型作为云平台的获客入口。Token 毛利下降,只要带动的云资源和企业服务收入足够大,整体收益仍然可能增加。

Meta:让模型层商品化,争夺开放生态

Meta 选择开放模型权重。让开发者和企业自行部署、微调和优化模型。

这种策略相当于把模型许可价格压到很低。同时把推理成本交给云厂商和使用者承担。Meta 获得开发者生态、技术标准和应用能力。也会压缩闭源模型的长期定价空间。

当开放模型逐渐达到足够好的水平,闭源厂商就需要把收费点继续向 Agent、工具、企业安全和托管服务迁移。

Kimi、智谱等独立厂商:在局部市场建立能力溢价

缺少大型云业务和广告业务补贴的独立模型厂商,很难长期承受全面价格战。更可行的路径是集中在长上下文、Coding、复杂推理和垂直行业等高价值场景。

它们可以通过 API 兼容降低迁移门槛。通过旗舰模型和订阅计划获取收入。再用搜索、工具、Agent 服务和行业交付扩大客单价。例如 Kimi 把长上下文、编程 Agent 和深度推理作为重点场景。同时兼容 OpenAI API 格式,降低开发者接入成本。

这类厂商必须证明自己在某些任务上的成功率显著领先。能力相近、价格稍低的中间位置,很容易受到低价模型和大厂旗舰的双向挤压。

把各家厂商放进同一张博弈表

博弈方主要目标主导策略最大风险
OpenAI控制智能入口全价格带、订阅、Agent 生态低价模型侵蚀中端调用
Anthropic获得专业能力溢价高可靠、高价、企业服务能力差距缩小
Google带动云、搜索和办公生态低价引流、分层定价、捆绑生态协同无法转化为客户锁定
DeepSeek重设行业价格锚成本领先、峰谷定价、缓存低价低价难以形成持续利润
阿里 Qwen扩大模型与云生态开放权重、模型矩阵、云回收开源使用量无法转化为云收入
字节豆包获取高频调用和企业流量低价、消费端分发、火山引擎通用模型高度同质化
Meta推动模型层商品化开放权重、生态扩张模型影响力难以形成直接收入
Kimi、智谱建立局部能力溢价长上下文、Coding、Agent被低价与旗舰模型双向挤压

对手出牌以后,厂商如何反应

模型定价是一场连续博弈。每次降价、开放权重或能力升级,都会引发对手调整。

对手动作常见应对
低价模型大幅降价推出小模型防御,下调 Cache 和 Batch 价格,保留旗舰价格
旗舰模型提价挑选相近能力的型号降价,提供迁移优惠,争夺路由流量
开放模型达到可用门槛强化托管、SLA、安全、工具和 Agent 服务
云厂商进行捆绑销售独立厂商强调模型能力、平台中立和跨云部署
多模型路由平台扩大提供阶梯折扣,建设自有路由,用 Context 和工具绑定客户

这场博弈最终会形成三种市场均衡:

第一,通用 Token 高度同质化。价格逐渐靠近边际推理成本。

第二,前沿模型保持差异化。少数厂商继续获得能力溢价。

第三,企业市场通过长期合同谈判。Token 价格与 SLA、容量、安全和 Context 服务捆绑。

最危险的是中间位置。成本无法做到最低。能力又没有拉开明显差距。这样的模型既无法赢得价格战。也难以获得高端任务的价值溢价。

六、为什么 Token 单价长期下降,整个市场的花费仍可能上升

价格下降会释放原来不存在的需求。

当一次调用很贵时,企业只把模型用于少数重要任务。价格下降后,模型会进入每封邮件。每段代码。每次搜索。每个客服对话。Agent 又把一次短调用变成长时间、多步骤的连续执行。

可以把企业 AI 总支出写成:

AI 总支出 = 单位 Token 价格 × 每项任务 Token 数 × AI 执行的任务数量

第一项持续下降。后两项可能以更快速度增长。

这与历史上的计算机、带宽和云服务相似。单位成本越来越低。总消耗量和总市场规模继续扩大。Token 越便宜,企业越敢于让 Agent 阅读更多上下文。尝试更多方案。调用更多工具。

价格战真正争夺的也清晰了。厂商牺牲一部分单位毛利。希望自己承接未来增长最快的 Token 消耗量。

举个例子。十年前服务器租金很贵。现在便宜多了。但是云市场的总体支出却增长了十几倍。同样的道理适用在 Token 上。

七、未来三到五年,Token 定价会怎样演化

相同智能的价格继续下降,最前沿智能仍可维持高价

当低价模型达到上一代旗舰水平,旧能力会迅速商品化。新旗舰如果解锁新的高价值任务,仍能重新建立溢价区间。因此市场会同时出现两条曲线。固定能力水平的价格持续下降。能力最前沿的价格反复抬高后再下移。

价格表会从一维变成多维

未来的价格表会加入更多变量。包括推理强度、响应速度、上下文长度、缓存读写、峰谷时段、并发保障、数据驻留和工具调用。模型厂商会尽量让每一类客户为自己最在意的资源付费。

比如说。需要低延迟的客户多付钱。可以接受延迟的客户享受折扣。长上下文任务单独计价。缓存命中的调用价格更低。

多模型路由会成为价格发现者

单一模型很难在所有任务上同时做到能力最强、速度最快和价格最低。路由平台会根据任务难度、时延要求和预算实时选择模型。

一旦路由层掌握任务入口,它就能知道完成某类任务的最低有效成本。模型厂商的公开标价会变成报价。路由层掌握真实成交价与分配权。未来的重要竞争,将发生在谁控制默认路由。

想象一下。你提交一个任务。路由平台自动选择最合适的模型。便宜的用它。贵的也用。全程你不用操心。

可复用 Context 会形成新的价格层

长任务中,大量输入来自企业知识、历史对话、工具定义和工作状态。这些内容反复计算会产生巨额浪费。缓存价格大幅低于普通输入价格。已经表明可复用 Context 正从附属功能变成独立资源。

未来企业关心的指标会从用了多少 Token 扩展。到多少 Token 被重复计算。多少上下文可以复用。多少业务知识能跨模型保留。模型越频繁切换,稳定的 Context 层越有价值。

比如一个客服系统。每天的常见问题答案可以缓存在系统里。下次遇到类似问题直接从缓存读。不重新调用模型。

厂商收入会向 Token 之外迁移

通用 Token 的毛利被竞争压缩后,收入会更多来自订阅席位。Agent 服务。工具调用。企业 SLA。专属容量。安全治理。数据与 Context 管理。模型成为流量入口。利润分布在入口上方和周边服务中。

举个例子。微软 Copilot for Enterprise 不光收模型调用费。还收订阅费和集成服务费。这才是真正的收入大头。

八、普通用户和企业应该怎样比较模型价格

面对复杂价格表,可以先放下每百万 Token 最低价。用真实任务做一次小规模测试。

至少记录六个指标:

指标要回答的问题
单次任务 Token 账单输入、输出、缓存和工具一共多少钱
首次成功率不返工能否直接使用
平均重试次数为得到合格结果需要调用几次
人工审校时间人需要花多少时间检查和修改
任务完成时延等待是否影响业务流程
切换成本更换模型要不要重写提示词、工具和数据接口

最后计算每次成功任务的总成本。

这个数字能穿透大部分定价话术。低价模型如果需要频繁重试,可能并不便宜。高价模型如果显著减少人工并提高成功率,也可能更划算。缓存、Batch 和路由优化带来的节省,往往比追逐一张最低标价更大。

给你一个实操步骤。选 10 个典型任务。分别用 A 模型和 B 模型跑一遍。记录每个任务的实际花费和时间。算出哪个模型综合成本更低。

结语:Token 会越来越便宜,智能不会只有一个价格

大模型市场正在形成一套分层定价体系。

通用能力不断商品化。价格向成本靠拢。前沿能力持续打开新任务。价格靠近业务价值。缓存、Batch、峰谷和优先服务,把同一款模型拆成多个算力市场。Agent 与垂直应用继续向上走。开始按任务结果收费。

新模型每次发布,都在同时改写成本地板。价值天花板。竞争闸门。

因此未来最重要的问题不会是哪家 Token 最便宜。而会是:

谁能用最低的总成本,稳定完成最有价值的任务?

这才是 Token 定价博弈最后要回答的问题。

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论