我们从2011年坚守至今,只想做存粹的技术论坛。  由于网站在外面,点击附件后要很长世间才弹出下载,请耐心等待,勿重复点击不要用Edge和IE浏览器下载,否则提示不安全下载不了

 找回密码
 立即注册
搜索
查看: 142|回复: 0

[零组件/半导体] 简单说说算力网络:马斯克的10万卡集群组网

[复制链接]
  • 打卡等级:以坛为家II
  • 打卡总天数:198
  • 打卡月天数:0
  • 打卡总奖励:714
  • 最近打卡:2025-11-21 20:33:51

1940

主题

405

回帖

1712

积分

二级逆天

积分
1712
发表于 2025-6-9 23:01 | 显示全部楼层 |阅读模式

马上注册,结交更多好友,享用更多功能,让你轻松玩转社区

您需要 登录 才可以下载或查看,没有账号?立即注册

×

当前,万卡集群成为AI大模型竞赛的“入场券”,10万卡集群正成为科技巨头竞逐的新高地。例如,马斯克旗下xAI公司位于田纳西州孟菲斯市的Colossus超级智算集群,2024年底就投产了10万张H100 GPU卡。

Colossus集群采用超微的液冷机架,每个机架配备8台4U的液冷GPU服务器(64卡)和1个CDU(冷却分配单元)。每8个机架(512卡)为一组来配备网络设施,以便在大规模系统中实现小型集群部署。如下图所示。

230125cdef2add.png

CDU位于每个机架的底部,如下图所示。每个机架内都设有一个流体循环系统(使用专门的冷却液,而非普通水),为所有GPU 服务器提供冷却服务。

23012579bd5370.png

Colossus集群使用了英伟达Spectrum-X网络平台。Spectrum-X网络平台属于以太网络而非IB网络,在高效、低时延方面却足以媲美IB网络,同时还有以太网的可扩展性优势。

如下图所示,每台GPU服务器配备9个400GbE端口:除了GPU RDMA网络之外,CPU也有1个400GbE 连接,它采用的是一种完全不同的交换架构,GPU独立运行一个网络,集群的其他部分运行另一个网络。因此,每台服务器总共有3.6Tbps带宽。

2301254ad45ff5.png

据说,Colossus集群在训练Grok大模型时,凭借Spectrum-X网络平台先进的拥塞控制功能,系统数据吞吐量一直保持在95%。传统以太网在数千条流发生冲突时,只能提供60%的数据吞吐量。

2301263ee0af4a.png

那Spectrum-X网络平台究竟是何方神圣呢?

1、Spectrum-X的核心组件

Spectrum-4 SN5600:SN5600是专为AI优化的51.2Tb/s以太网交换机(如下图所示),支持64个800Gb/s端口或128个400Gb/s端口,通过动态路由技术实现高效流量调度。

2301264b3bede1.png

BlueField-3 DPU:提供400Gb/s的RoCE加速,与交换机协同实现端到端无损网络,减少数据包丢失和延迟。

230126a0a55a64.png

加速软件栈:包括Cumulus、DOCA框架及AI通信库(如NCCL优化),实现全栈性能调优。


2、Spectrum-X的核心技术

无损动态路由:基于优先级流量控制和逐包路径选择,避免拥塞丢包,有效带宽利用率从60%提升至95%。

性能隔离:通过可编程拥塞控制技术,确保多租户环境中不同AI任务互不干扰,性能波动降低2.5倍。

自适应路由:解决传统以太网哈希负载不均问题,显著提升存储密集型任务带宽(实测接近物理带宽95%)。

230126abbb17a7.png

小结:xAI公司的Colossus集群,通过Spectrum-X网络平台解决了超大规模AI训练的带宽限制,提升了有效带宽利用率,也推动了以太网从“通用传输”向“AI计算底座”演进,为未来百万GPU级集群提供了参考。



回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Copyright ©2011-2024 NTpcb.com All Right Reserved.  Powered by Discuz! (NTpcb)

本站信息均由会员发表,不代表NTpcb立场,如侵犯了您的权利请举报投诉

本站所有资料仅限参考学习交流,PCB原理图源码等所有资料不保证准确没问题,请不要用作生产。否则后果自负。

闽公网安备35062302000276号 | 闽ICP备2024076463号-1 | 论坛技术支持QQ群171867948 | 论坛问题,充值问题请联系QQ1308068381

平平安安
TOP
快速回复 返回顶部 返回列表