解密全球最大AMD GPU集群:8192颗MI325X芯片
TensorWave日前宣布建成全球最大的AMD GPU训练系统,集成了8192块AMD Instinct MI325X AI加速器,并宣称是全球首个规模采用直接液体冷却技术(Direct-Liquid Cooled)的AI训练集群。据TensorWave信息,这被认为是目前基于AMD硬件搭建的、规模最大的AI训练设施。该系统的一个重要特点是采用了直接液冷技术,这也是此类规模集群中首个公开确认使用该方案的项目。公开的图片显示,高密度机架内安装了亮橙色(部分为黄色)的密封冷却液管路,冷却液通过这些管道循环流动。TensorWave确认集群已处于运行状态。AMD Instinct MI325X加速器于2023年末发布,其后续型号MI350X/MI355X已在最近推出。MI325X采用多芯片封装设计,单块加速器封装有256GB HBM3e高带宽内存,内存带宽最高为6TB/s,FP8精度浮点计算性能峰值为2.6 PFLOPS。在硬件规格层面,MI325X与Nvidia的H200相近,同时具备一定的成本优势。然而,在构建计算节点时,MI325X平台存在一个结构性限制:单节点最多支持8块GPU互联。与此形成对比的是,基于Nvidia方案的节点可支持高达72块GPU互联。TensorWave在解决这一限制时,采取的策略是优化机柜级别的设备部署密度和散热能力。为此,其设计并部署了一套专有的直接液冷系统。该系统的核心机制是:冷却液通过密封管道流经覆盖在每块MI325X芯片表面的定制冷板,直接带走芯片产生的热量。每块MI325X加速器的典型热设计功耗(TDP)为1000瓦。整合8192块这样的加速器后,集群的理论峰值聚合内存带宽将超过2PB/s(即2000TB/s),其FP8计算吞吐量预估可达21 EFLOPS。实际的持续性能表现将显著依赖于任务如何在GPU间拆分(模型并行)、数据传输策略(数据并行)以及集群内部高速互连网络的性能。TensorWave的业务模式是提供该集群的云端算力租赁服务,因此实现特定人工智能模型在此集群上的有效扩展,其复杂工作将主要由租用该资源的客户承担。这项部署紧随TensorWave在2024年5月完成的一笔1亿美元A轮融资之后,该轮融资由AMD Ventures和Magnetar领投。当前市场多数主流云服务供应商主要采用Nvidia硬件构建AI算力平台。TensorWave的选择则完全基于AMD架构。该公司提及这一选择源于多方面因素,包括成本结构和基于对AMD ROCm软件生态在大型模型训练应用成熟度上的评估。目前,Nvidia的B100和H200加速器占据市场主导地位,被广泛应用于从AWS到CoreWeave等平台。TensorWave的这一项目被视为AMD拓展其在AI加速计算领域影响力的一项具体动作。TensorWave表示,当前的8192块MI325X集群仅是规划中的第一阶段。计划将在今年晚些时候将系统升级,集成AMD基于下一代CDNA 4架构的Instinct MI350X加速器。预计MI350X将支持更低精度的FP4/FP6计算,提供更高的内存带宽容量,但其设计功耗(TDP)可能显著增加,最高可达1400瓦。如此高的热功耗使得高效的散热方案,尤其是直接液冷技术,成为运行该芯片的必要条件,也印证了TensorWave当前液冷方案的前瞻兼容性。AMD的ROCm软件栈仍处于持续的开发和优化过程中。这次大规模部署,为其在实际生产环境中验证和完善提供了重要的测试平台。
AMD GPU集群:8192颗MI325X芯片 解密全球最大AMD 解密全球最大AMD GPU集群 谢谢分享 谢谢分享 1111111111111 8192颗MI325X ,最大AMD GPU集群
页:
[1]
2
