谁在乎大语言模型的成本?

谁在乎大语言模型的成本? 图片 1
谁在乎大语言模型的成本? 图片 2

你为什么要担心他们?大型语言模型承诺几乎无限的能力,担心电表感觉像是别人的问题。支持这部电影。让模型思考多久,对吧?

右。直到账单到来。

震惊

想象一下:你最好的聊天助手刚刚上线。几百次测试对话,一张你几乎不注意的账单,一个让团队兴奋的演示。你就发货。使用率会随着功能运行良好时的增长而上升。

干得好,你!更多用户,更长的会话,存在一个代理循环,现在每个用户操作调用模型三到四次,而不是一次。没人会改代码。

然后有人打开账单页面,期待看到上个月的数字,结果却看到了一个巨大的数字。遗憾的是,这种情况比我们愿意承认的还要频繁。

关于代币经济学的简要说明

这些成本意外令人惊讶的地方在于代币经济学的新颖性。普通云支出会根据你配置的资源:实例、数据库层级、核心——而扩展。而LLM的支出则随着对话的波动而扩展。

冗长的系统提示、用户粘贴长文档,或在错误响应后出现重试循环,都可能使一次请求的成本成倍,而无需更改任何代码。遗憾的是,问题是你仍然会为计算资源付费。

只是现在,计算资源是别人的行为迫使你使用的。

乘数

乘以不同供应商的不可预测性,做好应对影响的准备。你不喜欢锁定,所以一个功能运行在OpenAI,另一个运行在Anthropic。六个月前有人把一个成本敏感的批次作业迁移到了自托管模式。

每个平台都有自己的仪表盘、计费周期,甚至对“代币”的定义。这种缺乏集中化造成了危机,因为从来没有人能在特定日期范围内准确指出支出。

更糟的是,云计费系统通常只告诉你花费了多少之后你已经花光了,延迟甚至达到了几周。等警报响起时,你的请求已经发出,服务商已经收费了,剩下的办法就是关闭整个功能。

重新掌控

目前,LLM的成本是个风险。他们需要被这样对待。如果我们遵循基本的风险框架指南(我鼓励你们这么做),控制需要三大支柱:预防、检测和缓解。

从经验来看,良好的预防和检测能降低缓解风险

简而言之

LLM生态系统要求一种奇怪的双重视角:既有足够的炒作以持续建设,又有足够的怀疑态度去质疑发票会是什么样子。责任感比谨慎更重要,是将两者联系在一起的关键。

创新从来不是免费的,但随着服务提供者更加倾向于代币经济定价,成本不再只是高,而是变得不可预测。遗憾的是,不可预测性更难规划。

幸运的是,控制成本不需要重新培训工程师成为会计师。有专门用于代币成本管理的工具,我们的Otari就是其中之一,围绕它的生态系统在稳定成市场标准之前只会更加动荡。

如果你从这篇帖子中得到什么,我希望这是明确的规划和控制要求。我们不希望你成为社交媒体上又一个恐怖故事。如果你想知道如何利用Otari实现这一点,可以阅读我们的网站成本文档.

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论