hdy 发表于 2025-5-29 00:49

全球AI芯片之战:芯片全景分析与市场布局

本帖最后由 hdy 于 2025-5-29 00:50 编辑

近年来美国芯片出口管制政策持续加码,英伟达主力AI芯片出口中国大陆受限,且未来管制政策仍有进一步加码的可能。近年来美国不断加码对于高性能AI芯片的出口管制:1)2022年10月更新出口管理条例,提出总处理性能(TPP)和I/O带宽传输速率两大判断指标,禁止TPP不小于4800且I/O带宽不小于600GB/s的AI芯片向中国等地区出口,导致英伟达A100、H100等高端芯片出口受限;

2)2023年10月美国商务部再次更新出口管理条例,新增性能密度(PD)指标,并设置1.6、3.2和5.92三个门槛,A800、H800、RTX4090等芯片进入出口管制名单;3)2024年美国政府再次对出口管制条例进行修订,将管制范围从AI芯片扩大到所有搭载AI芯片的电子设备。今年4月9日,英伟达收到美国政府通知,即向中国(包括香港和澳门)出口的H20芯片也需要获得许可,4月14日,美国政府又通知英伟达该许可要求将无限延期。考虑到全球地缘政治风险的持续加剧,未来美国芯片出口管制政策仍存在进一步收紧的可能。英伟达推出的中国特供版AI芯片H20自2024年以来在国内市场仍占据较高份额。虽然H20的训练算力只有H100的15%左右,但其在CUDA生态、通信互联等方面相较于其他AI芯片仍具备显著优势,其中英伟达CUDA生态为开发者提供了全面的并行计算框架和高效的卷积操作,支持高效的深度学习模型训练和推理,国内大模型开发者切换到其他生态具备较高的转换成本。同时,H20保留了H200完整的NVLink和PCle带宽性能,NVLink互联带宽可达900GB/s,PCle双向带宽可达128GB/s,在组建大规模GPU集群方面优势显著;此外,相比于H100,H20还增配了HBM3显存容量(96GB)和带宽(4.0TB/s),能够加速模型推理过程中的Decode阶段,导致H20的推理性能优于H100,甚至接近H200。因此,短期内H20在国内市场仍占据较高份额。
AI芯片分为GPGPU、FPGA和ASIC三大阵营,国产芯片厂商以GPGPU和ASIC阵营为主。1)GPGPU:具有通用性强的特点,广泛应用于图像处理、AI训练等领域,可支持多种数据类型的运算,英伟达、AMD均采用GPGPU架构。国产代表厂商包括海光信息、壁仞科技、摩尔线程等,这类厂商核心技术团队大多具备AMD、英伟达等国际芯片大厂背景;2)ASIC:具有定制化、专用性强的特点,通常应用于某些需求量较大的特定领域,目前海外的谷歌以及国内的百度、阿里等互联网大厂自研AI芯片大多采用ASIC架构,主要应用于自身业务场景,且华为昇腾、寒武纪等厂商也均采用ASIC架构;3)FPGA:属于半定制化芯片,具有功能可修改、一次性成本低但量产成本高的特点,适用于算法更新频繁或市场规模较小的专用领域,主要厂商包括海外的赛灵思、Altera以及国内的复旦微电子、紫光同创等。

近10年来国产AI芯片厂商快速涌现,同时互联网大厂均开始推出自研AI芯片以满足自身业务需求。其中:1)互联网大厂:包括阿里平头哥、百度昆仑芯等,互联网大厂自研芯片多强调推理性能,主要应用于满足自身业务场景,包括淘宝产品搜索及推荐、百度智能搜索、腾讯云游戏等;2)华为昇腾:2018年华为发布昇腾310和昇腾910,正式切入AI芯片领域,其中,昇腾310主打终端低功耗AI场景,采用12nm工艺,2018年便实现量产;昇腾910采用7nm工艺,可用于AI训练,于2019年正式上市。目前昇腾910系列的主力产品910B综合性能处于国产AI芯片第一梯队,并且910C正在加速生产中,而华为在4月10日合作伙伴大会上又发布了下一代的昇腾920芯片;3)AI芯片初创公司:包括海光信息、寒武纪、壁仞科技、摩尔线程、沐曦等,这类厂商于近10年成立,核心团队大多拥有英伟达、AMD等国内外芯片或IT大厂的技术背景,其中部分厂商自成立以来便专注于AI芯片研发,也有部分厂商此前从事CPU或其他芯片研发,近年开始切入AI芯片领域。



以华为昇腾、海光信息、寒武纪、昆仑芯为代表的国产AI芯片厂商正加速追赶英伟达,目前华为昇腾910B已经基本可对标A100,而新一代的910C也有望成为H100的有力竞争对手。目前华为在人工智能领域的量产芯片有昇腾310与昇腾910两款产品,华为在2019年推出昇腾910芯片,并在2023年推出了升级版昇腾910B。昇腾910B作为华为主力AI训练芯片,在单卡性能上可对标英伟达A100,其FP16稠密算力达到320 TFLOPS,超越A100的312 TFLOPS,与英伟达H20相比,910B在计算能力和能效比方面均表现出色,但在显存配置、GPU互联带宽方面目前仍存在差距,同时正在进行生产的910C的FP16稠密算力达到780TFLOPS,内存带宽为3.2TB/s,综合性能接近H100的80%。此外,华为基于384块910C发布了CloudMatrix 384超节点,在系统层面上与GB200 NVL72展开竞争,CloudMatrix 384包含12个计算机架和4个交换机机架,FP16稠密算力达300PFLOS,是GB200 NVL72的1.7倍,总内存容量和内存带宽也分别是GB200 NVL72的3.6倍和2.1倍,目前已通过昇**正式商用。



寒武纪、海光信息、昆仑芯处于国产AI芯片第一梯队,其新一代主力产品思元590芯片、深算三号、昆仑芯3代未来有望对英伟达H20形成替代。1)寒武纪:2020年寒武纪推出首款7nm训练芯片思原290,INT8算力达到512 TOPS,接近A100的624 TOPS(非稀疏化),2023年年底发布了590系列,综合性能进一步提升,接近A100的80%;2)海光信息:2021年推出深算一号,2023年三季度推出的深算二号性能相对于深算一号提升约100%,且下一代深算三号进展顺利;3)昆仑芯:2020年昆仑芯1代实现量产,主要用于百度搜索引擎、小度等业务,2021年量产的昆仑芯2代较1代性能提升2-3倍,并且百度已点亮基于新一代芯片昆仑芯3代组件的万卡集群。此外,摩尔线程、燧原科技、天数智芯等国产AI芯片厂商已有产品上市,并在部分场景中实现了批量应用。

国产AI芯片厂商目前主要通过兼容CUDA以及自研两种方式来构建生态。1)海光信息、壁仞科技、摩尔线程等厂商采用兼容CUDA生态的方式,一方面,这类厂商在硬件层面上大多采用与英伟达类似的GPGPU架构,另一方面,这类厂商投入研发具备较高转换质量的编译器,用于CUDA代码转译,因此能够降低CUDA迁移难度并减少效率损失。短期来看,通过兼容CUDA构建生态的优势在于能够实现CUDA应用的低成本迁移,从而使开发者在不改变使用习惯的情况下逐渐过渡为使用国产芯片;2)华为昇腾、寒武纪等厂商致力于构建自主生态,这类厂商会针对自身AI芯片的特性通过自研构建软件栈,以通过软硬件协同更好发挥芯片性能,同时自主可控程度也更高。但在短期内,自建生态难度较大,这类厂商也会通过编译器实现对CUDA的兼容。而由于这类厂商多采用ASIC架构,CUDA迁移难度相对较高,在一定程度到会导致更大的性能损失。

海光信息DTK开放软件平台封装了AMD的ROCm相关组件,能够高度兼容CUDA生态,同时,海光大量采用国际主流开源方案,较大程度上降低了生态拓展难度。AMD的ROCm框架借鉴了CUDA的许多设计理念,同时经过多年兼容经验积累,在软件库、编译器、API接口等主要模块上与CUDA的相似度非常高,因而ROCm对CUDA具有高度兼容性。而海光DTK软件平台封装了ROCm生态相关组件,并基于DCU硬件进行优化并提供完整的软件工具链,能够充分发挥ROCm高度兼容CUDA的优势,以更低成本将CUDA上运行的应用迁移到海光平台上运行。同时,海光DTK充分利用国际开源社区,MIOpen、Eigen、RCCL等软件库均为目前的主流开源方案,一方面能够降低软件开发工作量,提升用户吸引力,另一方面也方便用户进行二次开发,从而提升用户体验。
华为昇腾自研构建了全栈AI计算基础设施、行业应用及服务,包括昇腾系列硬件、CANN异构计算架构、MindSpore AI计算框架等,打造完整的国产化AI生态,并通过软硬件深度协同,充分发挥芯片性能。其中,CANN是华为专为昇腾AI处理器设计的核心软件层,对标英伟达CUDA架构。CANN于2018年9月推出,目前已迭代至8.0.0 alpha001版本,提供了超过1400个硬件亲和的高性能算子,可覆盖主流AI框架的算力加速需求,同时开放了自定义算子开发能力,满足开发者算法创新需求。CANN具有三大优势:1)提供用户友好型API,易于开发,2)计算效率、数据处理效率、训练效率较高,3)支持云边端全场景;而自研的AI框架昇思(MindSpore)在国内开发者中的使用率排名第四,仅次于三大第三方框架。目前昇腾生态已初具规模,收录了紫东太初、智谱天启等大模型,适用场景涵盖多模态等,同时,昇思社区用户已超过1220万,收藏项目超过2.86万。



页: [1]
查看完整版本: 全球AI芯片之战:芯片全景分析与市场布局