Nvidia重启H20生产 H20的国产替代在哪里?
据路透社报道,受中国科技巨头的强劲需求,Nvidia已向台积电重新预订了30万颗H20 GPU订单。尽管H20重新生产大约需要9个月时间,再加上Nvidia库存的60-70万颗H20芯片,这意味着国内仍对H20芯片有着旺盛的市场需求。Nvidia CEO黄仁勋近期访问国内接受了大量的媒体采访,不久后重启了H20生产而在今年4月就有报道称,为了减小H20禁令带来的影响,包括腾讯、字节跳动与阿里巴巴等国内巨头就囤积了大量的H20芯片。这不禁让我们思考,这款为了符合美国出口法案而专门定制的AI GPU真的有那么香吗?咸鱼上有大量出售的全新H20 GPU卡这款“阉割版”H20芯片的性能肯定是不及Nvidia真正的旗舰H100产品,更不要说最新的Blackwell系列了。但有业内人士透露,H20针对AI推理任务进行了精细调优,在某些工作负载下甚至能超越H100的表现。即使是这样,也大幅限制了H20在实际中的应用,更何况H20已经是落后一代的产品,如何撑起数百万颗的市场规模?国内真的连抗衡H20的芯片都没有吗?本周华为在上海举行的世界人工智能大会(WAIC)上,现场展示了CloudMatrix 384系统,这套系统的核心是昇腾P910C神经处理单元,其内封装了两颗昇腾910C芯片。据介绍,其浮点性能是H20的两倍以上。业内普遍将CloudMatrix 384与Nvidia的NVL72对标,且认为尽管CloudMatrix 384组件技术稍微落后,但凭借规模优势,其性能是远超Nvidia NVL72的,比如其FP16的浮点性能高出60%左右,尽管HBM芯片技术落后于Nvidia NVL72,但却提供了超过3倍以上的HBM容量,以及2倍以上的带宽。当然,规模更大的劣势需要更大的占地空间、更高的能耗,以及更复杂系统带来的管理问题。昇腾P910C是什么?昇腾P910C NPU是华为CloudMatrix 384系统的核心,其内集成了两个计算核心(即昇腾910C),通过高速芯片互连技术连接。据介绍,其速率最高可达540GB/s,或者双向各270GB/s;两颗昇腾910C芯片可提供约752 TeraFLOPS的FP16或BF16算力。为了发挥出昇腾910C芯片的性能,每个NPU中配备了128GB的高带宽内存(即HBM),能为每颗910C提供约1.6TB/s的内存带宽,即总带宽3.2TB/s。昇腾P910C内部架构拓扑就当前数据来看,昇腾P910C的性能是不如H200的,FP16浮点性能低了约83 TeraFLOPS、HBM容量少了约13GB,内存带宽也少了约1.6TB/s,同时,P910C也不支持FP8数据。但相比H20而言,P910C是远远超过的,至少从技术参数来看,其是可以作为H20的替代版的。更何况P910C不只是一个单独的产品,基于P910C构建的CloudMatrix 384系统,不管从集群规模还是还系统性能方面,都具备优势。CloudMatrix 384技术概览众所周知,Nvidia NVL72中的GPU通过NVLink实现高速互连。华为CloudMatrix 384中也使用类似的UB(统一总线)技术实现NPU间的互连,就集群拓扑结构而言,其思路与架构与NVL72系统相似——实际上,所有类似的集群都采用类似的架构拓扑,这一思路可能可以追溯到存储行业的高端存储。CloudMatrix 384系统实际由48个节点服务器组成,每个节点内配备8个昇腾P910C NPU和4颗鲲鹏处理器,每个P910C加速器中都配备了14条28GB/s的UB链路(每颗910C 7条),以此连接到节点服务器内部的UB交换芯片(ASIC)上实现节点内互连(Level 1)。而与Nvidia不同的是,节点内的UB交换芯片还预留了额外的端口,用于连接Level 2的UB骨干交换机。正是这一设计,让系统内的NPU规模可以从单节点的8个NPU,扩展到单个机柜的32个NPU,乃至昇腾超级节点的384个NPU……或者还能更多。CloudMatrix 384系统拓扑大致如下:除了用于芯片间互连的UB网络外,CloudMatrix 384还使用了具备RDMA功能的高速以太网网络,这基本是高性能服务器集群的标配。CloudMatrix 384系统优势分析如果从单个加速器、单个节点或者单个机柜来看,CloudMatrix 384是远低于Nvidia NVL72的。但CloudMatrix 384系统内的加速器数量几乎是Nvidia NVL72的5倍,这使得其系统综合性能远远高于后者。而这远不是极限,据华为透露,CloudMatrix最多可以构建高达165000颗NPU的超级集群,而Nvidia NVLink技术的理论支持数量是576颗GPU。从应用场景来看,CloudMatrix 384系列在推理任务,尤其是AI行业近期涌现的大量混合专家模型(MoE)负载上是有优势的。因为更多的芯片意味着用户能够更有效地运用张量并行、数据并行或者专家并行等技术,从而提升推理吞吐量并降低单位token的总体成本。为此,华为还开发了名为CloudMatrix-Infer 的大模型推理服务平台,将预填充(Prefill)、解码(Decode)和缓存(Caching)过程解耦。通过UB网络实现了对缓存数据的高带宽、统一访问,从而能解决传统KV缓存为中心架构导致的数据局部性限制,并简化任务调度,提升缓存销量。从实测表现来看,在DeepSeek-R1模型上的测试显示,CloudMatrix-Infer 显著提升了性能:单颗 NPU 每秒可处理 6,688 个输入Token,同时以每秒 1,943 个 Token 的速率生成输出。在理想条件下,华为称其系统在预处理(Prefill)阶段达到了每 TeraFLOPS 算力每秒处理 4.5 个 Token 的效率,略高于Nvidia H800 的 3.96 个 Token/s/TeraFLOPS。在解码(Decode)阶段,CloudMatrix 384系统也展现出约 10% 的领先优势。当然,CloudMatrix 384系统的劣势也相当明显,最显而易见的就是能耗,据SemiAnalysis机构分析,其完整系统的总功耗可能高达600KW,而相比之下,GB200 NVL72系统的功耗约为120KW。同时,另一个需要注意的是采购成本,有消息称,CloudMatrix 384系统的售价约为840万美元,而Nvidia NVL72的售价约350万美元。当然,前提是有渠道能买到Nvidia NVL72系统。但是相比于Nvidia H20 GPU,CloudMatrix 384系统在性能上还是有明显优势的,但如今,BAT等国内巨头依然大规模采购技术落后的“阉割版”,这可能暗示,在生态、兼容性和总体TCO方面,国内替代依然有着巨大的提升空间。
学习进步积分!
页:
[1]
