
半年前我帮一个客户评估下一代训练集群的组网方案对方第一轮就抛来一个让我愣住的问题“NVLink Fusion跟UALink你站哪边”当时UALink在我看来还像个PPT协议结果翻开联盟成员名单AMD、Intel、Google、Meta、Microsoft、Broadcom全在里面阵仗一点不小。再回头研究NVLink Fusion的路线图发现NVIDIA已经把超节点互连从“机箱内的私线”升级为“覆盖整个机房的统一架构”。这两条技术线路的背后其实是两套完全不同的产业逻辑一个靠垂直整合把Scale-up的边界无限往外推另一个靠横向联盟把Scale-up做成可插拔的开放接口。今天这篇就顺着Chiplet这条暗线把两套方案的技术底座、产业意图和实际取舍一次讲透。1. 为什么超节点Scale-up互连突然成了兵家必争之地1.1 AI训练的瓶颈已经从“算力不够”变成了“互连不够”前几年做大模型训练大家脑子里最敏感的词是FLOPSGPU峰值算力多少、总算力多少、训练时间多少。但等你真把千卡万卡集群跑起来会发现另一个更致命的约束——数据在GPU之间挪不动。大模型训练里张量并行、专家并行、序列并行这些主流并行策略都要求GPU之间频繁做梯度同步和中间激活值交换。超大规模同步操作一旦落到跨机房甚至跨集群的网络路径上时延直接翻一个数量级训练效率跟着暴跌。业界提出一个叫“关键路径延迟”的指标当模型规模冲到万亿参数以上GPU之间的通信延迟每多出几微秒整个集群的MFU模型算力利用率就会掉好几个百分点。这就是超节点出现的原因把大量加速器通过低延迟、超高带宽的互连协议在物理上紧耦合为一个“逻辑上的巨型GPU”让通信路径尽可能短、共享内存的语义尽可能直接。而支撑这个逻辑巨型GPU的就是所谓的Scale-up互连。NVLink Fusion和UALink争的正是这个位置。1.2 Scale-up和Scale-out一字之差天壤之别很多人会把集群互连混为一谈实际上Scale-up和Scale-out是两条完全不同的技术路线从时延预算到协议语义都不一样。维度Scale-out互连Scale-up互连作用域机架间、跨机房机架内、节点内、GPU之间时延预算5~10微秒甚至更高亚微秒级理想低于500ns数据语义消息传递MPI/RDMA内存语义Load/Store、原子操作典型介质以太网、InfiniBand私有总线、CXL、NVLink规模量级万卡甚至十万卡几十卡到上千卡核心诉求大规模可扩展性极致的低时延和高带宽Scale-out解决的是“更多机器一起干”Scale-up解决的是“一台机器内部干得有多快”。前者可以容忍毫秒级波动后者连微秒级抖动都受不了。拿NVIDIA自己的产品线来对照最直观NVSwitch负责GPU之间的Scale-up交换InfiniBand负责GPU机架之间的Scale-out组网。NVLink Fusion的概念之一就是把这两层逻辑合并成一个统一的互连域让GPU访问远端GPU就像访问本地显存一样不再需要关心中间走的是哪一层网络。1.3 Chiplet是这场互连竞争的“隐形变量”再叠加Chiplet这条线整个格局就更有意思了。传统GPU是一整块大Die工艺节点一推进成本、良率、功耗都面临极限。现在主流加速器基本都走向了多Die封装NVIDIA的B100/B200内部就是两颗Die通过NVLink C2C互连AMD的MI300系列也是多颗CDNA Die通过Infinity Fabric封装在一起Intel的Ponte Vecchio更是堆了几十颗Die。Chiplet模式带来一个直接结果Die与Die之间、封装与封装之间、加速器与加速器之间的互连不再只是“插线”问题而是上升为架构设计的核心变量。封装内部的Die-to-Die互连有UCIe这类标准在管而封装之外加速器之间的Scale-up互连就成了NVLink Fusion和UALink主攻的战场。换句话说Chiplet把GPU从“一块芯片”变成了“一个由互连串联起来的分布式系统”Scale-up互连的价值空间被大大放大。2. NVLink FusionNVIDIA把Scale-up做成了“全家桶”式的总装车间2.1 从NVLink到NVLink FusionNVIDIA的互连谱系越来越清晰NVLink刚出来那会儿很多人只把它当成“显卡之间多拉几根线”。实际上它的演进路径非常清晰NVLink 1.0解决了双GPU直连问题NVLink 2.0扩展到8卡全互联NVLink 3.0引入NVSwitch把8卡扩展到更多节点NVLink 4.0把每GPU总带宽推到900GB/sNVLink 5.0直接翻倍到1.8TB/s。到NVLink Fusion这代NVIDIA想做的事情已经不再是“把更多GPU接在一起”而是把GPU、CPU、DPU、内存、存储全部纳入同一个互连结构里。按NVIDIA在GTC 2025上公布的路线图NVLink Fusion将Scale-up和Scale-out两类互连融合成一个统一网络。每个GPU的持续带宽以TB/s为量级连接介质同时支持铜缆和光缆域规模可以从单机架扩展到整栋数据中心。这相当于把原来的“私线”升级成了“私有云”所有组件都在同一套互连语义下工作。2.2 NVLink Fusion的技术底座NVLink C2C NVLink Switch 融合网络NVLink Fusion不是从零发明的它站在NVLink C2C协议和NVSwitch硬件这两块基石上。NVLink C2C是NVIDIA用来连接同封装内不同芯片的物理层协议最早用在Grace CPU和Hopper GPU之间的互连上实现了CPU与GPU的统一内存地址空间。NVLink Fusion把C2C的适用范围从封装内延伸到封装外通过铜缆和光缆多个GPU、多个CPU、DPU和网络设备都可以共享同一种缓存一致性的互连语义。硬件层面NVLink Switch是关键的“十字路口”。早先单颗GPU只能连相邻几颗GPUNVSwitch把拓扑从网格变成星型让任意两颗GPU之间的跳数降到最低。NVLink Fusion进一步在Switch层接入更多类型的设备等于在数据中心里搭建了一个超大号的互连矩阵。软件层面CUDA的地址空间模型天然受益。NVLink Fusion让开发者可以用“访问本地显存”的方式访问超节点内任意GPU的内存第三方库和框架不需要重写就能吃到Scale-up带宽。这种“把整个超节点当成单个设备”的编程心智是NVIDIA生态最深的一条护城河。2.3 NVIDIA的算盘用互连锁定下一代AI基础设施从商业角度看NVLink Fusion是NVIDIA在AI基础设施领域的一次“总包”战略不仅卖GPU还卖互连、卖网络、卖存储、卖调度。你把超节点的每一层都用了NVIDIA的方案整体性能一定是最优的但这个生态的排他性也最强。这种做法的好处是NVIDIA可以在架构层面做全局优化。比如GPU知道数据在远端哪个节点的哪块内存里网络路径怎么走最短、什么时候发起预取最合理这些跨层信息可以动态协调。坏处是一旦你要混用其他厂商的加速器或网络设备这套体系基本跑不通。对多数AI Infra团队来说NVLink Fusion就是“选NVIDIA选全套”不需要纠结技术细节躺平就好。但如果你所在的平台追求供应链多元化和成本可控这个全家桶就未必是最优解。3. UALink开放标准阵营打出的一张“反封锁牌”3.1 UALink联盟的成军几乎就是“非NVIDIA势力”的集结号UALink全称Ultra Accelerator Link目标是定义一份面向AI加速器Scale-up互连的开放标准。联盟阵容相当豪华AMD、Broadcom、Cisco、Google、HPE、Intel、Meta、Microsoft、Arm、Dell、Oracle都在里面基本覆盖了除NVIDIA之外整个AI芯片产业链的头部玩家。这么多人坐在一起共同的诉求是“不想让NVIDIA把互连标准的定义权也拿走”。过去十几年NVIDIA靠CUDA锁住了软件生态靠NVLink锁住了硬件生态。CSP云服务商和服务器厂商如果想在AI芯片上保持选择权就必须在互连这层拿到话语权。UALink就是把分散的“反NVIDIA力量”拧成一根绳的尝试。3.2 UALink 1.0技术要点高带宽、低延迟、共享内存语义UALink 1.0规范面向的是加速器之间的点对点Scale-up互连核心指标围绕带宽和延迟展开。物理层采用与PCIe Gen 6同代的SerDes技术单通道速率超过90Gbps多通道聚合后每端口带宽可达数百Gbps。面向内存语义设计支持对端内存的读、写和原子操作让AI计算框架可以像访问本地内存一样访问远端加速器内存。协议上借鉴了CXL和PCIe体系积累的底层互连经验不用从零解决信号完整性和链路训练问题。初期版本面向机架内短距离场景铜缆即可覆盖后续版本预计扩展到光缆以支持更大规模的超节点。联盟的路线图很清晰先从几十个GPU的Scale-up域做起逐步扩展到上百乃至上千加速器的超节点最终形成一套能够对抗NVLink Fusion的开放互连方案。3.3 UALink面临的“标准落地三座大山”规范和产品之间隔着三座大山产品化、互操作性、生态。产品化层面UALink 1.0发布之后AMD的MI400系列、Intel的下一代加速器都计划支持但目前还停留在纸面阶段。一个互连标准从规范到硅片、再到系统集成和量产通常要两到三年的时间。互操作性层面多厂商支持的代价是每个厂商都要在通用规范之上做取舍和实现谁先落地、谁后落地、谁先和谁测过互通都会影响实际部署节奏。生态层面最现实就算硬件支持UALink软件栈能不能像CUDA那样提供统一内存访问模型有没有现成的通信库和深度学习框架适配才是大规模落地的关键。NVIDIA花十几年建立的软件护城河不是一个标准协议能够轻易绕开的。4. NVLink Fusion和UALink的四个正面战场4.1 带宽、时延、规模纸面数据谁更激进先做一张硬碰硬的表格还原两边当前披露的核心指标。对比维度NVLink FusionUALink 1.0技术血统NVIDIA私有基于NVLink C2C开放标准基于标准SerDes单GPU总带宽1.8TB/sNVLink 5.0后续持续翻倍多通道聚合目标对标NVLink同级时延目标亚微秒级内存语义直访亚微秒级共享内存语义超节点规模从几十卡起步路线图直指上千卡1.0面向数十卡后续扩展至上千卡连接介质铜缆光缆机架内外兼顾初期铜缆为主后续向光缆演进发布状态已进入NVIDIA路线图绑定新一代平台1.0规范已发布处于产品化早期软件生态CUDA全家桶深度集成生态初建依赖框架适配从纸面看NVLink Fusion的带宽指标更激进因为它可以“量身定制”整个互联协议栈UALink则要顾及多厂商兼容性能和规范发布节奏会更稳健一些。4.2 Chiplet视角封装内外怎么配合Chiplet的核心理念是“分而治之”把一颗大芯片拆成多个Die分别用最合适的工艺制造再通过先进封装互连起来。问题是Die与Die之间的互连密度、带宽、功耗和延迟直接决定了Chiplet方案的成败。NVLink Fusion在Chiplet层面的布局是闭环的。NVIDIA自家的GPU内部用NVLink C2C把多颗Die拼成一颗逻辑GPU封装之外再用同一套互连协议扩展到其他GPU、CPU、DPU。也就是说从Die到Device到Node再到DomainNVIDIA用的是同一套语言任何一层都不需要协议转换。UALink在Chiplet层面则更像“搭桥者”。它不关心Die内部怎么互连只负责封装外部的加速器到加速器连接。这对第三方芯片厂商来说反而更友好不管你的加速器内部用的是UCIe、Infinity Fabric还是其他私有互连只要外部提供符合UALink的接口就能进同一个超节点。开放性换来的是更大的灵活性代价是跨Die、跨封装、跨节点的全链路协同优化能力不如NVLink Fusion那么极致。4.3 生态位之争CXL、UEC、UALink、NVLink Fusion谁管哪一层互连标准最忌讳“什么都想管”最后谁也兼容不了。现在业内各标准的分工逐渐清晰CXL管的是CPU与内存/设备之间的缓存一致性和内存扩展位置在CPU近端UEC管的是超大规模Scale-out以太网面向机架间和跨集群通信UALink管的是加速器之间的Scale-up互连目标是机架内的高带宽低延迟域NVLink Fusion则是一个“越界者”它把Scale-up和Scale-out合并成一棵互连树甚至向上吞掉了部分UEC的应用场景。对开发者来说最理想的状态是各层标准像积木一样拼插组合CPU节点走CXLGPU之间走UALink机架之间走UEC大家互不干扰。但NVIDIA显然不愿意让自家超节点里出现“别人家的协议”NVLink Fusion的设计哲学就是全栈自洽。两种思路的碰撞注定会持续很多年。4.4 历史不会简单重演但可以参考互连标准战的最终胜负往往不取决于技术指标而取决于生态厚度。回头看看PCIe与各私有总线的竞争或者InfiniBand与以太网在HPC领域的拉锯战会发现一个规律开放标准在产业界永远有生存空间因为下游客户天然抗拒被单一供应商锁定。CSP手里动辄几亿美元的资本开支不可能全部押在一条封闭路线上。UALink的价值不仅仅在于性能对标NVLink更在于它给了买家一个“备选方案”式的谈判筹码。另一方面NVIDIA的先发优势和软件生态优势又非常现实。NVLink Fusion只要按期交付超节点领域的大部分需求会被它吸收UALink能抢到的市场大概率是那些明确不接受NVIDIA封闭生态的CSP和自研芯片厂商。5. 落到实际项目里超节点Scale-up互连到底该怎么选5.1 先搞清楚你的超节点处在哪一层很多时候我们讨论NVLink Fusion和UALink其实是在讨论一个“未来的超大规模问题”。对大多数团队来说真正需要做决定的时刻还没到或者根本不需要做决定。我的建议是先给自己的项目定位如果预算和团队能力都围绕NVIDIA展开模型训练也依赖CUDA生态那现阶段更务实的做法是直接用NVLink 5.0/NVL72方案等待NVLink Fusion节奏落地即可没必要为了“不被锁定”而刻意拆掉自己最顺手的工具。如果你是云厂商、大型CSP或者自研AI芯片团队的成员同时有大量AMD、自研ASIC、第三方加速器的接入需求那么UALink是唯一现实的选择它能让多源异构加速器在同一个超节点里共存。如果你只是做几十卡规模的中型集群哪边都不需要押注PCIe/CXL 以太网的常规组合已经足够覆盖需求Scale-up互连的性能红利在中小规模下并不明显。5.2 我做集群互连方案时踩过的几个“认知坑”第一个坑把纸面带宽当成实际可用带宽。无论是NVLink还是未来的UALink厂商标称的都是物理层极限真正跑训练任务时要面对协议开销、链路竞争、拥塞控制、驱动效率这些损耗。实测下来能达到标称值60%到70%就已经算优化得不错了。评估方案的时候千万别只看峰值数字。第二个坑忽略布线长度对信号完整性的影响。Scale-up互连的带宽越高对链路长度越敏感。铜缆在机架内还能撑住一旦跨机柜拉长信号衰减和误码率都会显著上升。落到具体部署光模块选型、线缆走线、散热空间都要提前做物理层仿真否则等设备上架了再返工整个交付周期直接失控。第三个坑对开放标准的“兼容性”抱有幻想。UALink虽然定位开放标准但“开放”不等于“开箱即用”。多厂商的互操作验证需要时间驱动成熟度更是因厂而异。选择UALink方案时大概率要预留出比NVIDIA方案更多的验证和调优周期安排专门的团队去啃驱动和通信库的适配。5.3 我给未来18个月划的几个关注节点接下来真正值得盯的是这几个时间窗NVIDIA新平台正式搭载NVLink Fusion的时间这将决定封闭路线的实际性价比边界UALink联盟成员的第一批量产芯片和互操作测试结果这决定开放路线的可信度主流AI框架PyTorch、JAX等对两种互连的适配程度软件栈的跟进速度往往比硬件更能决定生态走向超节点从“训练专用”走向“推理和混合负载通用”之后两种互连在功耗和成本上的差距是否会拉开新的差距。我在实际参与集群组网方案时最深的一个体会是互连协议的选择从来不只是技术问题它同时是供应链策略、软件生态策略和长期运维策略的交叉路口。NVLink Fusion赢在“整合体验”UALink赢在“选择自由”双方在未来很长一段时间内会共存而不是一方彻底吃掉另一方。如果你现在正处于选型阶段我的建议是保持架构设计的开放性把设备层、互连层、软件层解耦就算今天选了某一边也别把未来切换路径彻底堵死。互连标准这东西最怕的不是选错而是选完之后发现自己被困在原地。