AI Agent比常规聊天机器人查询多烧136倍电力
AI智能体不仅比聊天机器人思考得更久,而且在这一过程中耗电量也大幅增加,但几乎没有开发者将其纳入成本考量。
韩国科学技术院(KAIST)的一个团队为许多开发者所怀疑、却鲜有清晰量化的问题给出了确切数字。在该团队发表于HPCA 2026的论文中,运行于一个拥有700亿参数模型上的AI智能体,在最重负载的测试配置下,每处理一次请求平均消耗348.41瓦时电量,是单纯问答基线模型耗能的136.5倍。
这并非微小的差距,而是将AI视为软件功能与将其视作电力负荷之间的巨大区别。
这项研究由KAIST教授Minsoo Rhu领导,Jiin Kim、Byeongjun Shin和Jinha Chung共同署名,论文题为《动态推理的成本:从AI基础设施视角解密AI智能体与测试时扩展》。
KAIST发布的新闻稿指出,该团队将智能体视为数据中心的工作负载,而不仅仅是精巧的软件演示。这一区分至关重要,因为智能体并非一次响应即止,而是会规划、调用工具、等待、读取结果,有时还会重试,然后再向模型提出新问题。
账单就藏在这一次次的循环之中。
空闲GPU的难题
Kaist的研究发现,对于智能体工作负载,响应时间可能最多延长至原来的153.7倍;而在外部工具执行任务期间,GPU的空闲时间甚至可高达总执行时间的54.5%。
硬件费用照付,数据中心持续运转,机器只是在等待。
这对任何大规模运行此类系统的人来说都应引起重视。一个客服智能体在完结工单前调用三次API并重试两次,其成本绝非一次简单的聊天机器人回复所能比拟,即便两者起点相同。
智能体更像是一道小型工业流程:实用、可重复,且“胃口”不小。
Kaist还模拟了一个场景:AI智能体每天处理137亿次请求,这一规模大致相当于全球Google搜索的流量。在这种情况下,仅智能体相关的数据中心用电需求就将达到约198.9吉瓦,接近美国全国平均用电量的一半。
请将此视为一项压力测试,而非预测,但它仍不失为一个有益的警示。
坦率地说,大多数初创公司的定价模式并未为此做好准备。
电网已现紧张迹象
恰逢其时,KAIST的这篇论文愈发不容忽视。美国能源信息署(EIA)在9月的《短期能源展望》中预计,2026年美国电力销售量将达到4,1350亿千瓦时,2027年则增至4,2110亿千瓦时,其中商业用电需求将贡献主要增量,而数据中心正是其中的重要组成部分。
S&P Global旗下的451 Research也在不断上调其估算。5月,S&P报告称,2025年美国电网向超大规模、租赁及加密货币挖矿数据中心提供的电力约为64.4吉瓦,到2030年可能攀升至约183.2吉瓦。
这些数字本身已相当可观,若再叠加因工具调用而产生的“自主性”能耗放大效应,更是令人警醒。
德克萨斯州的案例生动展示了数据表与电网现实的碰撞。Utility Dive在8月报道称,州长Greg Abbott下令对ERCOT互联系统排队中的数据中心展开审计,原因是大容量申请总量已达约474吉瓦,超过ERCOT历史峰值需求的五倍。
随后,ERCOT推迟了针对大型用户的“零批次”审查程序——这是该州用于管理数据中心及其他高耗电设施的新机制。
这已不再是一场抽象的基础设施辩论。
如果你的产品运行着能够规划、调用工具并重试的智能体,那么每完成一项任务的实际成本绝非聊天机器人的水平。主流模型服务商的算力定价体系大多仍引导创业者关注token数量,而智能体的经济性则要求你紧盯循环次数、等待时长、工具失败以及隐藏在看似简单的用户任务背后的空闲硬件。
这并不意味着智能体AI走入死胡同,而是说效率如今已成为与模型质量同等重要的产品特性。能让智能体以两次工具调用而非八次完成任务的创业者,不仅交付了更快的产品,也经营着一家比那些完全不关注这一指标的竞争对手更为经济的企业。
真正棘手的并非那几瓦时的能耗。用户不会在意他们的智能体为预约会议、编写代码、查询数据库或关闭客户工单究竟烧掉了多少电,他们关心的是产品是否缓慢、昂贵,或者在公司摸清自动化的真实成本后突然涨价。
这才是这篇论文的核心所在。智能体时代或许尚处早期,但电费账单早已等不及市场成熟了。
延伸阅读: 法国刚刚铸造了六位来自Mistral和Hugging Face的AI亿万富翁 • Palantir的Shyam Sankar称AI末日论是一种筹款噱头 • 一种新的循环循环变换器声称拥有无限的人工智能推理深度
本文刊载于人工智能新闻,欢迎查看更多相关报道。