hdy 发表于 2025-6-24 00:26

UALINK的几个关键特性


引言 — LLMs所需的高带宽域(High-BW Domain,HBD)需求不断增长,这不仅体现在首次Token响应速度或工作负载适配高带宽内存的能力上,更受到每秒Token的输出需求上。智能体(agentic)应用和推理类(reasoning)应用对响应时间的要求日益严苛。这些新兴AI工作负载的性能和容量扩展,需要scale up网络的支撑。UALink 提供了一个开放、基于标准的基础协议,专为支持机架规模(Rack Scale)AI工作负载而设计。
UALINK所提供的scale up网络,在英特尔未来的数据中心 AI 产品中扮演着重要角色。本篇文章为英特尔网络与AI芯片专家对于UALink 的几个关键特性的介绍:

[*]内存语义协议
[*]低延迟交换
[*]高效且可扩展的带宽
[*]In-Cast 与拥塞容忍
[*]网络可靠性
[*]低成本与优化的总体拥有成本(TCO)
[*]集合通信卸载
[*]机密计算
[*]开放标准与生态系统





内存语义GPU等加速器工作负载高度可编程,与基于内存语义的网络天然契合。这些负载本身就依赖内存语义(如 load、store、atomic 操作)来访问多种类型的内存资源,包括加速器的 HBM、CPU 的 DDR、PCIe 对等设备的 MMIO 等。
[*]远端加速器上的缓冲区可以轻松映射到与本地其他类型内存一致的加速器虚拟地址空间中。
[*]具备片上内存语义网络的加速器,可用于访问本地内存,并延伸到大规模系统中的内存语义互联,其实现复杂度和成本都较低。

内存语义通信可实现加速器之间的超低延迟通信,这是实现AI工作负载规模化的关键。
[*]Store 或写操作:可以将数据直接从发起加速器的引擎写入远程加速器的缓存或内存,远程引擎可低延迟读取使用。
[*]Load 或读操作:可以从远程加速器的缓存或内存中读取数据,并立即返回给发起加速器的引擎使用。
[*]原子操作(Atomic):可以修改远程加速器的缓存或内存,例如用于信号量操作。

低延迟交换当加速器之间进行通信时,网络延迟是一项额外开销,并会叠加到整体的集合通信延迟中。集合算子通常包含多个步骤或通信阶段,这进一步放大了网络延迟的影响。

UALink 通过简化事务处理和路由机制,并减少前向纠错(FEC)带来的负担,从而实现极低的交换延迟,有助于显著降低网络整体延迟。进一步地,基于内存语义的通信协议可以通过网络写操作实现低延迟通信,避免了加速器之间通信路径中完整的往返时延(RTT),从而提升通信效率。
高效且可扩展的带宽加速器的scale up网络的带宽需求,取决于具体的工作负载类型及加速器的计算能力(以 Bytes:FLOP 比衡量)。

加速器通常借助两方面实现高带宽:其一是采用如 UALink 提供的、针对内存语义优化的高效链路协议;其二是通过在多个并行接口(通常称为“多通道”或 multiple rails)之间进行负载均衡来实现带宽的水平扩展。
In-Cast 与拥塞容忍能力AI 工作负载会扩展到多个加速器。为避免 in-cast(多路同时发送至同一路径)和网络拥塞,通常会通过协调集合通信方式(如环形或树形算法)进行优化,但部分 in-cast 情况仍难以完全避免。
UALink 采用基于 credit 的流控机制,能够有效应对 in-cast 和拥塞期间的网络压力,使网络在不产生不良影响的前提下持续稳定运行。
网络可靠性网络可能面临多种错误来源,包括持续性错误和瞬时性错误。持续性错误虽然发生概率较低,但通常需要人工介入处理;而瞬时性错误则更为常见,若未能及时缓解,可能会对工作负载造成影响。
在大规模或高带宽网络中,瞬时性错误尤其容易发生,常见问题包括不可纠正的 FEC 或 CRC 错误、链路错误、数据通路中的错误等。此外,一些网络在发生拥塞且缺乏足够缓冲资源时,还可能出现丢包现象。UALink 针对这些问题专门设计,具备如下可靠性保障机制:
[*]通过采用 基于 credit 的流控机制,避免因拥塞导致的数据包丢失;
[*]通过 链路级重传机制(LLR, Link Level Replay),可在小于一微秒的时间内,从不可纠正的 FEC、CRC 或链路错误中恢复,避免仅依赖端到端机制所带来的大尾延迟问题;
[*]通过采用 ECC 等技术,鼓励实现高可靠性的数据通路设计,以避免通路中的软错误对系统造成影响。

TCO优化scale up网络的成本将直接影响产品的总体拥有成本(TCO),且这一比例在整机柜(rack scale)系统的TCO中持续上升。因此,实现系统功能与性能需求的同时,以最低成本构建互联解决方案,是当前设计的核心目标之一。
规模化互联网络的主要成本包括:
[*]加速器芯片IP授权与封装面积、I/O接口分布、以及电力传输成本;
[*]交换芯片(Switching ASIC)、供电系统、电路板、可管理性/控制平面开销、以及基础设施与机箱结构;
[*]通道成本,如电连接器、cable、cable wall/中板,甚至可能包括光模块解决方案。

尽管上述成本在所有类型的规模化互联方案中都难以完全避免,UALink通过以下方式有效降低成本并优化TCO:
[*]避免使用庞大复杂的网络接口控制逻辑(NIC logic),从而减少加速器和交换芯片的Die面积与功耗;
[*]优化交换架构,采用更简单紧凑的路由表和浅缓冲设计;
[*]最重要的是,大幅简化了管理接口设计,进一步降低了系统复杂性与运营成本。


集合通信卸载(Collective Offloads)将集合通信卸载到scale up网络中,旨在为阻塞型通信带来延迟上的优势,或为非阻塞型通信带来卸载优势,使加速器引擎可以继续执行其他重要任务。预期的收益取决于具体工作负载,需综合考虑计算与通信的重叠能力以及通信的延迟敏感性;但对于AI推理工作负载来说,通常更偏向于降低延迟。UALink 2.0 将基于内存语义协议,提供集合通信卸载功能。
集合通信的延迟受多种因素影响,包括集合类型(如 reduce、all-reduce、broadcast 等)、数据规模(KB、MB、GB)、规模大小(加速器数量)以及网络和加速器的延迟。
集合通信卸载带来的主要延迟优势包括:
[*]由于通信发生在加速器与交换机之间,而非加速器之间,网络延迟和往返时间(RTT)显著减少;
[*]传统点对点(P2P)集合算法通常采用环形或双叉树算法,延迟随着加速器数量线性或对数增长,且受网络RTT和加速器开销影响;而交换机内部的集合卸载可以实现环形或树形归约操作,交换机端口间的延迟仅为几十纳秒,相比P2P通信中常见的1微秒及以上延迟,整体通信延迟得到大幅降低;
[*]典型的P2P All-Reduce通信需要发送和接收几乎两倍的数据量,而卸载后的All-Reduce仅需传输和接收一倍数据,理论上带宽利用率提升一倍,有效降低大型集合操作的通信延迟。

机密计算(Confidential Compute)许多工作负载因涉及大量知识产权投入或处理敏感机密数据而具有较高的安全需求。为了安全地运行这些工作负载,必须保障数据和任务的保密性,防止信息泄露;同时保障完整性,防止任务被篡改。

UALink 针对高带宽内存语义协议提供了高效的安全机制,既实现了数据和计算的保密性与完整性,又在安全设计中优化了成本,包括芯片面积、功耗、设计复杂度、性能与延迟,以及管理的便捷性,兼顾安全与效率。
UALink 的scale up网络技术在 Intel 未来的数据中心 AI 产品中扮演着重要角色。
UALink 于 2025 年 4 月发布了 1.0 版本规范,重点优化了内存语义协议。该规范对众多 IP、交换芯片和产品厂商开放,不限制使用或要求知识产权授权,推动形成真正的开放标准。推动包括集合通信卸载等创新功能,是 UALink 2.0 规范的下一阶段演进的目标。


lanziguang 发表于 2025-6-24 06:32

:):):):):):):):):)
页: [1]
查看完整版本: UALINK的几个关键特性