晶圆级集成技术用于人工智能处理器设计
理解晶圆级集成的基本概念
晶圆级集成代表了半导体设计中最具挑战性的方法之一。传统半导体制造工艺会将一片硅晶圆切割成数百个较小的芯片,而晶圆级集成技术则相反,工程师们在整个晶圆上创建一个巨大的处理器。这个概念在过去五十多年中一直吸引着计算机架构师的关注,但直到最近才在人工智能应用中变得实用。
晶圆级集成技术的基本原理在于最大化处理能力,同时最小化困扰传统多芯片系统的通信瓶颈。当连接多个独立处理器时,每个连接都会引入延迟、功耗和带宽限制。通过将所有组件保持在单片硅上,这些问题可以显著减少。图1:由84个17.1 x 30毫米²reticle组成的单个WSI芯片,展示了Cerebras Systems晶圆级处理器的物理布局,演示了如何将整个晶圆组织成称为reticle的处理单元网格。每个reticle本身就是一个强大的处理器,但通过片上连接而非外部布线进行直接通信。处理能力的巨大优势
将晶圆级集成的规模优势与不同架构的核心数量进行比较时,其优势变得明显。传统中央处理器单元通常最多包含64个核心,这反映了拥有更少但更强大处理单元的设计理念。图形处理器将这个数字推得更高,现代设计包含数万个较小的、针对并行计算优化的专用核心。图2:不同架构处理核心数量的比较。GPU:Nvidia H100(814毫米²reticle)和CBS:Cerebras晶圆级引擎(WSE-3,513毫米²reticle)。说明了这种戏剧性的扩展效应,展示了晶圆级集成如何在单个器件上实现近90万个处理核心。这比目前最先进的图形处理器多出近两个数量级的处理能力。
通信架构在传统多芯片系统和晶圆级设计之间也存在根本差异。在传统高性能计算集群中,各个处理器必须通过串行输入/输出连接进行通信,这会产生瓶颈并增加功耗。图3:(a)通过NV链路与串行I/O连接的GPU芯片与(b)通过并行I/O在芯片上连接的CBS reticle的对比说明。演示了晶圆级处理器如何通过在处理单元之间提供直接并行连接来消除这些通信瓶颈。这种架构差异使处理器不同部分之间能够实现更高的带宽和更低的延迟通信。工程挑战与解决方案
创建功能性晶圆级处理器需要解决几个工程挑战。最重要的挑战涉及电源传输,因为传统的将电源连接到各个芯片的方法在处理单个大型器件时变得不实用。图4:Cerebras晶圆级引擎(WSE)集成器件上每个reticle连接的理想设置说明,显示了工程师必须实现的理想垂直连接方案,其中每个处理reticle都需要自己的电压调节、输入/输出连接和冷却系统。这创建了一个远超硅本身的三维设计问题。
这种垂直集成方法的实际实现可以在实际硬件设计中看到,工程师们将输入/输出连接推到晶圆边缘,并在整个表面区域优先考虑电压调节。图5:WSI左下角3×3 reticle的芯片照片,显示Screw Hole和I/O,揭示了晶圆级设计的另一个独特方面:将机械紧固件直接集成到硅中。这些螺丝孔对于分配在如此大的器件上维持电接触所需的巨大夹紧力是必要的。
图6:与WSI接口的电路板照片,显示reticle中电压调节模块的优先化,显示了如何安排支持电子器件以向晶圆级处理器的每个部分提供充足的电源传输。电压调节模块占据了大部分可用空间,突出了电源传输如何主导设计考虑。时钟分配和时序挑战
在整个晶圆上同步信号带来了在较小处理器中根本不存在的时序挑战。信号必须传播的物理距离会产生到达时间的变化,这可能会干扰正常操作。图7:修改为使用2×电源电压向芯片传输信号的驱动器示意图,通过片上端接实现1×电压分。显示了信号完整性问题的一个解决方案,工程师使用更高的电压电平和仔细的端接方案在晶圆上的长距离保持清洁的信号传输。
时钟策略的选择在晶圆级别变得重要,需要在延迟、功耗、设计复杂性和可测试性之间进行权衡。工程师必须平衡这些竞争需求,同时确保在温度和电压变化下的可靠操作。图8:向reticle的准同步时钟路由,说明了准同步时钟方法,在异步操作的简单性和全同步设计的性能之间提供了折衷。质量保证和可靠性
确保如此大器件的可靠性需要创新的测试方法,因为传统的半导体测试方法对于晶圆级器件来说变得不实用。诸如Screw Hole等机械特征的存在产生了必须彻底表征的额外可靠性问题。图9:WSI中Screw Hole和密封环的显微照片,显示了硅内Screw Hole的详细实现,包括防止assembly期间污染和机械损坏的保护密封环。
图10:三点弯曲测试的三个代表性实验,用于找到螺丝孔形成的最佳条件,演示了确保这些孔不会产生可能导致灾难性器件故障的断裂点所需的广泛机械测试。
晶圆级器件的认证过程必须考虑传统加速测试方法的不实用性,导致创新的系统内老化程序,在实际操作条件下对整个系统进行应力测试。图11:生产中筛选晶圆所需的电压和芯片温度余量说明,显示了必须表征的操作参数空间,以确保在所有预期条件下的可靠操作。
图12:核心故障数量作为VDD电压和应力测试小时数的函数,用于(a)原始核心故障和(b)修复后的新核心故障,呈现了可靠性数据,显示器件在扩展应力测试下的表现,证明正确设计的晶圆级处理器可以实现生产部署所需的可靠性。晶圆级计算的应用前景
用于人工智能的晶圆级集成代表了我们处理高性能计算方法的根本转变。通过解决电源传输、信号分配、机械集成和质量保证的挑战,工程师已经证明可以创建具有处理能力密度的处理器。这项技术为解决以前难以处理的计算问题提供了新的可能性,特别是在可以充分利用大规模并行处理能力的人工智能应用中。随着晶圆级集成技术的不断成熟,我们可以期待看到更加雄心勃勃的实现,推动硅基计算的边界。当前的成功实现为未来更大规模和更复杂的晶圆级系统奠定了技术基础,这将继续推动人工智能计算能力的发展。
页:
[1]
