谁在乎大语言模型的成本?


你为什么要担心他们?大型语言模型承诺几乎无限的能力,担心电表感觉像是别人的问题。支持这部电影。让模型思考多久,对吧?
右。直到账单到来。
震惊
想象一下:你最好的聊天助手刚刚上线。几百次测试对话,一张你几乎不注意的账单,一个让团队兴奋的演示。你就发货。使用率会随着功能运行良好时的增长而上升。
干得好,你!更多用户,更长的会话,存在一个代理循环,现在每个用户操作调用模型三到四次,而不是一次。没人会改代码。
然后有人打开账单页面,期待看到上个月的数字,结果却看到了一个巨大的数字。遗憾的是,这种情况比我们愿意承认的还要频繁。
关于代币经济学的简要说明
这些成本意外令人惊讶的地方在于代币经济学的新颖性。普通云支出会根据你配置的资源:实例、数据库层级、核心——而扩展。而LLM的支出则随着对话的波动而扩展。
冗长的系统提示、用户粘贴长文档,或在错误响应后出现重试循环,都可能使一次请求的成本成倍,而无需更改任何代码。遗憾的是,问题是你仍然会为计算资源付费。
只是现在,计算资源是别人的行为迫使你使用的。
乘数
乘以不同供应商的不可预测性,做好应对影响的准备。你不喜欢锁定,所以一个功能运行在OpenAI,另一个运行在Anthropic。六个月前有人把一个成本敏感的批次作业迁移到了自托管模式。
每个平台都有自己的仪表盘、计费周期,甚至对“代币”的定义。这种缺乏集中化造成了危机,因为从来没有人能在特定日期范围内准确指出支出。
更糟的是,云计费系统通常只告诉你花费了多少之后你已经花光了,延迟甚至达到了几周。等警报响起时,你的请求已经发出,服务商已经收费了,剩下的办法就是关闭整个功能。
重新掌控
目前,LLM的成本是个风险。他们需要被这样对待。如果我们遵循基本的风险框架指南(我鼓励你们这么做),控制需要三大支柱:预防、检测和缓解。
从经验来看,良好的预防和检测能降低缓解风险
简而言之
LLM生态系统要求一种奇怪的双重视角:既有足够的炒作以持续建设,又有足够的怀疑态度去质疑发票会是什么样子。责任感比谨慎更重要,是将两者联系在一起的关键。
创新从来不是免费的,但随着服务提供者更加倾向于代币经济定价,成本不再只是高,而是变得不可预测。遗憾的是,不可预测性更难规划。
幸运的是,控制成本不需要重新培训工程师成为会计师。有专门用于代币成本管理的工具,我们的Otari就是其中之一,围绕它的生态系统在稳定成市场标准之前只会更加动荡。
如果你从这篇帖子中得到什么,我希望这是明确的规划和控制要求。我们不希望你成为社交媒体上又一个恐怖故事。如果你想知道如何利用Otari实现这一点,可以阅读我们的网站成本文档.