简单说说算力网络:马斯克的10万卡集群组网
当前,万卡集群成为AI大模型竞赛的“入场券”,10万卡集群正成为科技巨头竞逐的新高地。例如,马斯克旗下xAI公司位于田纳西州孟菲斯市的Colossus超级智算集群,2024年底就投产了10万张H100 GPU卡。Colossus集群采用超微的液冷机架,每个机架配备8台4U的液冷GPU服务器(64卡)和1个CDU(冷却分配单元)。每8个机架(512卡)为一组来配备网络设施,以便在大规模系统中实现小型集群部署。如下图所示。CDU位于每个机架的底部,如下图所示。每个机架内都设有一个流体循环系统(使用专门的冷却液,而非普通水),为所有GPU 服务器提供冷却服务。Colossus集群使用了英伟达Spectrum-X网络平台。Spectrum-X网络平台属于以太网络而非IB网络,在高效、低时延方面却足以媲美IB网络,同时还有以太网的可扩展性优势。如下图所示,每台GPU服务器配备9个400GbE端口:除了GPU RDMA网络之外,CPU也有1个400GbE 连接,它采用的是一种完全不同的交换架构,GPU独立运行一个网络,集群的其他部分运行另一个网络。因此,每台服务器总共有3.6Tbps带宽。据说,Colossus集群在训练Grok大模型时,凭借Spectrum-X网络平台先进的拥塞控制功能,系统数据吞吐量一直保持在95%。传统以太网在数千条流发生冲突时,只能提供60%的数据吞吐量。那Spectrum-X网络平台究竟是何方神圣呢?1、Spectrum-X的核心组件Spectrum-4 SN5600:SN5600是专为AI优化的51.2Tb/s以太网交换机(如下图所示),支持64个800Gb/s端口或128个400Gb/s端口,通过动态路由技术实现高效流量调度。BlueField-3 DPU:提供400Gb/s的RoCE加速,与交换机协同实现端到端无损网络,减少数据包丢失和延迟。加速软件栈:包括Cumulus、DOCA框架及AI通信库(如NCCL优化),实现全栈性能调优。2、Spectrum-X的核心技术无损动态路由:基于优先级流量控制和逐包路径选择,避免拥塞丢包,有效带宽利用率从60%提升至95%。性能隔离:通过可编程拥塞控制技术,确保多租户环境中不同AI任务互不干扰,性能波动降低2.5倍。自适应路由:解决传统以太网哈希负载不均问题,显著提升存储密集型任务带宽(实测接近物理带宽95%)。小结:xAI公司的Colossus集群,通过Spectrum-X网络平台解决了超大规模AI训练的带宽限制,提升了有效带宽利用率,也推动了以太网从“通用传输”向“AI计算底座”演进,为未来百万GPU级集群提供了参考。
页:
[1]
