不是光站在那里,也不是站在光里,而是要追着光
本文以英伟达的NVL72计算网络架构为例,计算AI 数据中心对光模块的数量需求与GPU数量的关系。
结论:光模块的需求数量在未来10年将增长大于100倍。
下图是英伟达的计算网络架构基本拓扑:
可以看到NVL72作为一个基本计算单元,先连接到Leaf Spectrum 交换机上,再连接到Spine 交Spectrum换机上;
每个NVL72 里面有72个GPU 核心:
Scale-up 场景下:
每个GPU 出18个NVlink(4x200G)与NVswitch 相连;现在这里的连接方式是铜缆;
Scale-out 场景下:
同时每个GPU 出1个 800G(4x200G)端口 与Leaf Spectrum 交换机相连;
Leaf交换机,spectrum-x800交换机 有128个800G 接口,64个连接NVL72, 64个连接Spine 交换机;
Spine 交换机128个全作为下行链接;
可以得到一个GPU,在NVL72 通过光模块连接到Leaf Spectrum 交换机,同时对应有一对光模块把Leaf交换机和Spine 交换机相连; 所以对应的光模块的数量是一个GPU 对应4个光模块。
在Scale out 场景下,光模块空间 = GPU x 4;【注: 在极短距离下,也会使用部分铜线DAC/AEC/ACC,因为覆盖距离短,用量比例相对较小】;
如果后续Scale-up 连接也开始逐步的演进到光连接:
(1) 2028年 Feynman平台,开始使用400G/Lane 部分柜内NVlink 将转光
在448G/Lane 同轴能传输距离开始缩短到不到2m,考虑到封装、连接器插损等,实际传输距离不到1m; 那么柜内的部分NVlink连接,就需要开始使用光连接;
(2) 2032年左右 下一代800G/Lane 平台, 800G的传输距离,毫无疑问将限制在不到50cm,板内连接可以考虑继续使用铜缆, 柜内跨板连接,将走向全光
也就是不到6年的时间里,每个GPU 出的18个铜缆NVlink 连接NVswitch,在2032年的时候,将转为18x2=36个光模块;
所以在NVL72 Scale-up 场景下,光模块的空间 = GPU x 36= 1/2 x ( 72x72 )
GPU算力节点的部署每年也在大幅增长,假设每年增长1倍; 那么10年就是1024倍;扣除工艺原因产生的单GPU 计算能力提升红利;假设GPU 部署10年后的部署相对于今天翻>10倍【年均增长26%】;
以NVL72为基础,10年后AI 数据中心光模块的空间潜在空间是:
总结:
光通信未来的空间增长有两个大的维度:【算力增长】 x 【Scale-up柜内转光】;
这块的增长是巨量的,是AI领域为数不多的与GPU的数量呈平方关系的产业, 所以我们不要站在光里,我们要追寻光的每一个痕迹,光照耀之处,将是勃勃生机: 小草将成为大树、大树将成为森林......
$东山精密(SZ002384)$ $中际旭创(SZ300308)$ $新易盛(SZ300502)$
本话题在雪球有22条讨论,
点击查看。
雪球是一个投资者的社交网络,聪明的投资者都在这里。
点击下载雪球手机客户端 http://xueqiu.com/xz