hdy 发表于 2025-6-1 01:06

TSMC 硅光400G/lane演进方案公布,NV光互连OIO方案变相官宣--GTC Taipei 2025震撼发布

本帖最后由 hdy 于 2025-6-1 01:09 编辑

在5.21-23的GTC Taipei 2025(COMPUTEX 2025)上,TSMC的KC hsu(徐国晋)做了一个报告“ Semiconductor Technology for HPC/Networking”,在这个报告中发布了TSMC在AI计算域OE的方案和演进路径,信息非常丰富,不仅印证了业界目前的很多的猜想,同时也可以解读出很多的有用信息。这报告是NV和TSMC联合报告的一部分,也就是这里面的信息可以视为NV在OIO方面的官宣。一、NV的硬核需求,每个代际的带宽翻倍,doubling!      前段时间,大家都在讨论NV目前基于以太网高速serdes生态的演进节奏已经赶不上nvlink的发展了,nvlink5.0的serdes已经是200G了,在NV的产品路标上,rubin系列GPU还是有两代的nvlink6.0/7.0,GPU的带宽又翻倍了,nvlink8.0/9.0怎么演进呢?还能继续暴力演进吗?scale-out的quantum和spectrum的速率也到200G/lane了,下一步怎么走呢?这次KC hsu的报告给出了一个明确的线索,下图就是这次报告中KC hsu给出的TSMC的硅光的roadmap。    首先,AI计算希望带宽的演进节奏是每个代际的带宽翻倍,doubling    这个需求显然是来自于NV,这是一个非常的硬核的需求,实现起来难度非常大。但是从更大的产业环境来看,也是合理的。XPU的制程还是在不停的演进,摩尔定律也一直在延续,所以,需要在整个摩尔定律的大背景下来推进互连带宽的演进,一旦网络的互连带宽不能跟上,就意味着摩尔定律在AI计算域的影响力受到很大的限制,各位看官不觉这是一非常重要的事情吗?所以必须搞定!    其次,NV多年前布局的DWDM光互连方案正式走向前台    在带宽持续的演进过程中,硅基微环这个天选之器,悄然而至,虽然有点桀骜不逊,难以驾驭,但是,其毕竟是驾着七彩祥云而至的。在这里TSMC也给出了肯定的答案,400G采用微环方案,即上图中的DWDM的方案,应该是50G*8。现在回过头来想一下,TSMC演进路径其实已经准备好了,在IEDM2024上的这篇论文《23-3_Tue_Yeh_0068》,已经给了我们明确的答案,分析见CPO的春天来了,OIO还会远吗?。其实,在NV在2020年的GTC大会上(见下图),就给我们展示了DWDM(OIO)的方案,这次TSMC把这件事情做实了。    只是,这次使用的是400Gbps,而不是2020年规划的200gbps per fiber。在5年前就开始了规划,一直到现在才开始官宣,老黄这盘棋下个够长的。    再次,TSMC也给咱秀了一下他们的背后功夫    经过一系列的变态的测试,包括Damp Heat (DH) - 湿热测试,HTS - 高温存储测试 (High Temperature Storage),MR3X+TCC 300x - 机械可靠性测试与温度循环测试组合,TCG 1000X - 温度循环测试。在这些测试的结果中,光路的插损一直表现很好,和关键指标还有一个0.25dB隔离带。可见其在胶水的稳定性、键合力以及金属的耐腐蚀性等方面表现优异。    二、基于400G/lane的GPU什么时候会来到?会出光吗?    既然400G/lane的方案确定了,那么什么时候NV会在其GPU系统中使用呢?scale-up网络直接使用光互连,这会引起整个行业的局变。    上图是老黄在GTC 2025加州上show的图片,即27年的Kyber架构的NVL576还是采用正交背板的电互连架构,即此时的GPU还是没有直接出光。   我们再排一下NVlink和NVswitch的对应表,见下。

      其实,我们从上面的图表中可以看到,27年Kyber虽然使用的是正交背板,应该是沿用GPU出电的思路,但是,NVlink已经演进到了7.0,rubin ultra如果此时直接使用400G PAM4,或Bi-directional的400G压力也是比较大的,如果还是使用200G,感觉也不是老黄的风格。    如果我们假设nvlink 8.0是400G 出光的话,那么rubin的nvlink 7.0出400G的电接口就会显得有点得不偿失了。或者光互连是否会提前?直接在nvlink 7.0直接一步到位,直接出光,也不能说不可能。最近获得一个非常可靠的消息,博通的XPU出光将在年内公开demo演示,那么估计两年内会出现XPU出光估计会商用,如真如此,这种风头如果被其它公司抢走,这可不是老黄的风格啊。    也就是说,预计最迟在28年,我们会看到NV的GPU会直接出光,即GPU的scale-up域会出现GPU之间的直接的光互连。    三、NV的superPOD的形态是什么样的呢,规模可支持到多大呢?    首先,我们要看一个大背景,即scale-up网络规模越大,计算的效率越高,这样才能更好的满足LLM的sclaling law对于算力扩张的需求,只是在这个scale-up网络在工程实现上受限后,才会使用scale-out网络,把数据在多维度划分为块,再进行并行处理。    其次的一个因素则是GPU数据的时延对于计算的影响,光纤1米需要飞行5ns,10米则需要50ns,所以需要在空间上做压缩。    还有一个因素就是几级的clos组网,例如B200的NVL72是一层组网,即是一个3级的clos网络,数据需要3跳达到目的。NVL576则是两层组网,是一个5级的clos网络,数据多过一层的交换机,时延增加40%,所以,必须把scale-up网络的层数压下来。要压下来这个网络的层数,又要让网络的规模尽量的大,首要的是增加nvswitch的NVlink数量,单片nvswitch的nvlink的数量就是GPU最多的节点数,节点数多了,自然整个网络的GPU的数量就多了。    支持B200的NVswitch第4代,支持72个NVlink(144 lane),一层的scale-up网络可以做到NVL72,如果NVswitch可以支持1024个lane,一个nvlink需要两个lane的话,一层的scale-up网络则可以支持512个GPU。如果一个nvlink使用1个lane,则可以支持1024个GPU。也就是说即使使用光互连的话,组成千卡级的scale-up网络也是有一定难度的。    当如,如果使用两层的clos网络对scale-up进行组网,10万网卡甚至更多也应该是可以实现了。如果这样的话,scale-out网络的需求可能就会下降了吧。    下图也是GTC 2020中展示的使用DWDM的光互连的概念样机,我觉得大概是这样的一个形态吧,但是,随着GPU的直接出光,产品的形态,预计会发生比较大的变换,让我们拭目以待吧。 四、多波低速,将支持光互连带宽的持续演进?    从目前的高速I/O的推进路线来看,一条是高速serdes,IEEE从刚开始的10G,一直到目前的224G,光电速率同步推进,现正在向448G艰难地迈进。在今年的OFC2025微软表示在高速的serdes中200G可能是一个甜点,产业界需要平衡技术的难度和收益。    从AI算力对于网络带宽的需求来看,目前的高速serdes的演进节奏感觉还是太慢了,虽然这个速度加快了,但是要满足智算网络对带宽的需求,还是力不从心。假如我们从10G的serdes开始统计,下面是IEEE的serdes代际的更新数据。

   这次tsmc的光互连,给我们另外一个全新的思路,就是放弃目前主流的高速光互连和高速serdes同步高速演进的方式,当光电同步的推进不能迅速推进的时候,直接采用更加适合光互连的技术路径,让电向光看齐,当然,这必然是一个艰难的选择,会有一段路要走。这个思路类似于以前CPU的发展,当主频提升很艰难的时候,多核是一个很好的选择,同样,当单路的光翻翻很艰难的时候,多波长就是柳暗花明又一春了。   下图是IMEC的OIO的演进的示意图,甚至可以达到128波,还可以按照模来增加调制信息,技术手段很多,如果按照这个思路,光互连在带宽的路径上还可以演进很长的时间,也可以很好的契合算力演进的需求。lightmatte的1.6T/fiber的商用方案,今明年预计会上市。    当然我们看到NV/TSMC联盟以及IMEC等在把dwdm定位这么高,后面的因素是他们在微环方面投入了很多的研究,并获得了一定的成功。五、产业链的配套,I/O光源    当大家在讨论OIO和多波长的时候,谈到了比较多的是微环调制器如何设计,一致性如何保障,波长对齐如何控制。其实,在这个产业链中,OIO的光源,也是一个非常重要的点。    在目前的多波长的光互连系统中,一般会按照CW-WDM这个光源的标准来要求。梳状光源是一个理想的选择,但是目前不论是克尔光频梳,还是锁模激光器,都存在多多少少的问题。连ayar labs也是使用阵列光源。所以,希望产业链能关注这方面的研究。    光源不但是集成度、效率和功耗的问题,还是整个系统可靠性的核心点。


页: [1]
查看完整版本: TSMC 硅光400G/lane演进方案公布,NV光互连OIO方案变相官宣--GTC Taipei 2025震撼发布