Al账单越高,浪费越大?三个动作立省一半
一家公司每月花几十万在 AI 上,却只用了它应有价值的一小部分。
奇怪吗?矛盾吗?这其实是当下的常态。
大多数公司同时存在两个问题:花了太多钱在已经用的 AI 上,但实际上用的 AI 远远不够。
账单看起来大不大,跟花了多少钱关系不大,跟你能不能说清楚这些钱换来了什么关系很大。
把这个问题想清楚,只需要三件事:用任务衡量价值而不是 token、设置更聪明的默认值、知道什么时候该多花钱。
https://engineering.ramp.com/post/ai-spend-value
Token 是个没用的单位
先问一个简单的问题:10 万美元能买多少 AI?
同样的钱,买顶级闭源模型能拿到 50 亿 token,买开源模型能拿到 2100 亿 token,差了 42 倍。
但这个数字告诉你的只是"买了多少",不是"做了多少事"。
Token 衡量的是消耗,不是价值。
不同任务消耗的 token 差异极大,根本没有可比性。
真正应该看的单位是工作本身:审完一个 PR、处理一张发票、发出一封销售邮件。
这些是可以定价、可以比较、可以算 ROI 的原子单位。
还有一个更根本的问题:AI 供应商按用量收费,不管任务成不成功。
这意味着你的账单里混着两类支出:
成本 = 尝试的任务数 × 每次尝试的费用
价值 = 成功的任务数 × 每次成功的价值要想不亏,就得同时做两件事:提高成功率,压低单次成本。
如果没认真审计过自己的 AI 用量,大概率两件事都没做好。
默认设置在悄悄坑你
每次 AI 请求背后有三个关键选择:用哪个模型、让它想多深、要求它多快响应。
供应商替你做了这些决定,并设成了默认值。
这些默认值的目标是让尽可能多的人用起来,不是让你的钱花得最值。
模型选择:顶级模型只配顶级问题
每当新一代顶级模型发布,上一代就变成了"半价次优"。
大多数公司的反应是:把所有工作流都升级到最新模型,因为"更好嘛"。
这是今天软件行业里最隐蔽的烧钱方式之一。
顶级模型存在的意义,是解决更难的问题,不是把同样的工作做得更好一点点。
用最贵的模型处理客服工单,就像雇博士生做小学数学题,钱花出去了,多余的智力全部浪费。
Ramp 的做法是:从能通过质量标准的最便宜模型开始,只有任务真正需要时才往上走。
各家供应商的能力排行榜,用的都是刻意设计得极难的测试题。
你公司里需要自动化的任务,绝大多数是中等难度以下,排行榜上所有模型都能轻松应付。
默认原则:从能过质量线的最便宜模型开始,任务有需要再升级。
推理深度:别让模型过度思考
现在很多模型允许调节"思考力度",供应商默认开到最高。
每往上调一档,消耗的 token 大约翻倍。
但在普通任务上,更深的推理只是让模型反复确认它已经答对的答案,你在为"双重检查"付钱。
默认原则:推理设为中档,只有任务明确需要时才调高。
响应速度:同样的答案,贵一倍
同一个模型,供应商通常卖几个速度档位。
"快速模式"和"弹性/批处理模式"给出的是同样的答案,区别只是快几秒。
弹性模式通常只要快速模式一半的价格。
判断要不要付速度溢价,有个简单标准:有没有人在等这个结果? 用户在实时对话里等回复,值得付速度钱。
自动化流程跑完没人马上看,批处理模式就够了。
默认原则:关掉快速模式,配合中档推理。延迟仍然比供应商默认值快。
什么时候该多花钱
便宜模型处理日常工作,这个逻辑成立。
但有些场景,顶级模型的溢价完全值得。
一个更强的模型,可能发现一个能省掉几个月返工的架构决策,可能在漏洞被利用前找到安全隐患,可能给出团队自己想不到的解法。
这一个洞察,比所有日常用量加起来的价值还高。
难度和价值的关系是反的:简单任务量大,复杂任务价值高。
把所有工作分成两类就够了:
- 常规工作:边界清晰、重复性高,用能过质量线的最便宜模型。
- 高难工作:模糊、新颖、高风险,用当下最好的模型,全力推理,多次采样,预算放开。
你 99% 的工作量落在第一类,几乎所有的潜在价值在第二类。
用便宜模型省下来的钱,放在贵的模型上用。
最难改变的默认值:文化
技术上的默认值能拦住不调设置的人。
但一旦有人开始主动选择,激励机制就开始作怪。
写代码的工程师不看账单,他只对结果负责。
选最大的模型、开最高的设置,是最安全的职业选择,没有人因为用了顶级模型而被批评。
把这个选择乘以所有工程师和所有功能,就得到了一笔没人刻意为之、也没人负责的超额支出。
管好 AI 成本的公司,都把效率当成工程成就,不是当成约束。
用更小的模型、更低的推理、更慢的响应拿到同样结果,和上线新功能一样值得庆祝。
目标不是少花钱,是让每一块钱都挣到它该挣的回报。
明天就能开始做的八件事
实际上,少数几个工作流驱动了账单的大头:一个没人盯着的自动化、一个忘了关快速模式的功能、一个出于谨慎用了顶级模型的需求。
不需要优化所有东西,找到那几行就能解决 80% 的问题。
- 按供应商、产品、团队、工作流拆分 AI 支出。 订阅费和 API 用量分开,人工交互和自动化分开。
- 把支出换算成工作单位。 处理了多少发票,解决了多少工单,审了多少 PR。
- 找到成本集中点。 驱动大头支出的工作流先动。
- 给重复性工作设基准。 不要抽象地说"用便宜点的模型",要测试哪个便宜配置还能过质量线。
- 改掉默认值。 常规工作不该从顶级模型、最高推理、最快响应开始跑。
- 明确定义升级路径。 让任务在模糊、高风险时能方便地切换到更强的模型。
- 每次重大模型发布后重新定价。 新模型改变了整个梯队,把发布当成成本优化事件,不是自动升级信号。
- 集中管控。 在一个网关里统一管理,不要散落在每个代码库和团队里。
账单太高和用得太少,是同一个问题的两面:你还没把浪费和价值分开。从这里开始。