一个 token 要花多少钱
<p>我一直在思考一种更好的方法来计算大型语言模型的投资回报率,不用说,我开始认为代币并不是我们应该衡量的错误单位,原因很简单<strong>一个“更智能”的大型语言模型应该能让你达到同样的结果,只需更少的回合(也许还有代币)。</strong> </p><p>在大多数“代理工作负载”中,大多数令牌是输入令牌。这些令牌是内存:仓库、对话、工具输出、指令,每回合都会重新发送。计票是记忆成本,乘数是上下文×回合数。</p><p>一项任务的全部成本为:</p><ul><li>每回合解决×上下文×输入价格</li><li>+ 生成代币×输出价格</li><li>+ 人力回合×负重成本</li><li>+ 必要的重做</li></ul><p>我们以一个前沿模型的粗略价格进行调试任务 ~ 每百万输入代币3美元,输出15美元。</p><ul><li>十四回合,每次6万上下文代币:84万个输入代币,2.50美元</li><li>2万个输出代币:$0.30</li><li>工程师满载时间的90分钟:150美元</li></ul><p>现在做同样的任务,但:</p><ul><li>6回合,40k,温缓存:24万个缓存代币,价格仅为标价0.07美元</li><li>2万个输出代币:$0.30</li><li>工程师满载时间的四十分钟:65美元</li></ul><p>这两个会话在两个独立轴上不同:纪律(缓存/上下文)和深度,代币账单无法判断哪个更便宜的会话处于哪个轴。</p><p>仅用代币,第一场游戏的代币成本大约是8倍,但最重要的是,<strong>这两个数字在总计算中都是噪声</strong>,直到需要操作员的必要重做介入。如果较便宜的会话发布了一个需要一天才能找到并恢复的漏洞,最终可能花费800美元(1天工程时间+原65美元)。</p><p>这样写给我们看了两件事:</p><ul><li>首先,提示缓存能将重发上下文的…</li></ul>









