[硬件] Meta Muse 每人一台 2C8G 虚拟机, 1 亿用户要多少颗 CPU?两种算法差了 30 倍

Meta 的个人 AI 助理 Muse 给每个用户配一台专属虚拟机。据 Wccftech ,规格是 2 vCPU 、8GB 内存、100GB 固态硬盘。模型推理在别处的 GPU 上跑,虚拟机这一层只吃 CPU 、内存和硬盘。

于是有人算:如果做到 1 亿用户,要多少颗 CPU ?我看到两种算法,结果差了大约 30 倍。

往多算:158 万颗

Wccftech 的算法最粗:

  • 1 亿用户全部同时在线
  • 每人 2 个 vCPU ,1 个 vCPU 占 1 个物理核
  • CPU 按 126 核一颗算

结果是 158 万颗。它自己也给了打折的版本:一半人在线约 79 万颗,一成人在线约 15.8 万颗。

往少算:约 5 万颗

分析师 Freda Duan 的算法:

  • 每人每天用 2 小时,平均同时在线约 833 万台
  • 乘高峰系数 2.5 ,再留 20% 余量,是 2,500 万台
  • 虚拟机约九成时间在等模型返回结果,CPU 几乎闲着,所以每台只算 0.5 个物理核
  • 合计 1,250 万个物理核

按 256 核一颗折算,约 5 万颗。这一步折算是我做的,原文只给到核数。

差在哪

两边的分歧其实就两个参数:

  1. 同时在线率:100% 对大约 8%
  2. 超卖比:1 vCPU 对 1 核,还是 4 vCPU 对 1 核

做过虚拟化的应该都有体感,后者更接近实际。但助理这类负载有个特点:用户关掉 App 之后任务可能还在跑,在线率未必像网页应用那么低。

供给那一头

  • TrendForce 说服务器 CPU 交期已经到 25–30 周,平衡时是 16–20 周
  • 英特尔 CEO 说目前只能满足大约一半的需求
  • TrendForce 引的数据:部分代理任务的 CPU 对 GPU 配比是 4:1 到 40:1

所以不管按哪种算法,新 CPU 都得排队。

1 亿用户是假设,Muse 现在只在美国和加拿大上线,上线 12 天 iOS 下载量 180 万。

想听听做虚拟化和容量规划的同学怎么看:这种「大部分时间在等 IO 」的负载,你们会按多少超卖比来配?

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论