超节点(Super Node / SuperPod)深度科普(上):为什么出现、是什么、靠什么实现

从 WAIC 2026 的一面「墙」说起:Scale-up 本质、主从 vs 对等架构、互联/语义/保序/池化/散热的全套取舍

Posted by tanjunchen on Saturday, October 3, 2026  ·  阅读  ·   ·  预计阅读约 24 分钟

写在前面

过去一到两年,AI 基础设施圈最热的词之一是「超节点」(Super Node / SuperPod)。它听起来像营销话术,背后却是一个很硬的工程命题:当单卡、单机、甚至传统集群都「不够用」时,怎么把几十上百张加速卡「粘」成一台逻辑上的超级计算机。

这个系列分上下两篇,用一条主线讲清五件事 —— 为什么需要 → 是什么 → 靠什么实现 → 谁在怎么做 → 往哪走:

  • 上篇(本文):背景与动机、核心概念与定义、关键使能技术。先把「为什么」和「是什么」讲透。
  • 下篇:代表性产品与方案对比(NVL72、CloudMatrix 384 及国产图谱)、典型应用场景、挑战与未来趋势。回答「谁在做、往哪走」。

数据口径说明:本文 NVIDIA 数据来自官方 GB200 NVL72 规格(2024-03 GTC 发布)与公开 Datasheet;华为数据来自华为 2025-04 CloudMatrix 384 发布会、华为全联接大会 2025(HC2025,2025-09)徐直军演讲与 2026 WAIC 公开资料,以及 SemiAnalysis(2025)第三方测算。各家口径不完全一致,已尽量标注。硬件迭代极快,具体以厂商最新发布为准。


1. 背景与动机:为什么「单卡/单机/集群」都不够用了

1.0 从 WAIC 2026 的一面「墙」说起

2026 年世界人工智能大会(WAIC 2026)上,最吸睛的不是某块芯片,而是一整面由 16 台计算柜拼成的巨型阵列——华为昇腾 950 超节点真机,1024 张算力卡密集嵌入,被称为「业界公开最大规模超节点」。它旁边,阿里、中兴、壁仞、沐曦、摩尔线程、百度(天池)、中科曙光、新华三等几乎所有国产算力玩家都搬来了自家超节点真机或方案。「超节点」第一次从技术幕后,站到了算力战争的舞台中央。

一个很自然的疑问:一台服务器插 8 张卡用了这么多年,为什么现在要把成百上千张卡拼成「一面墙」? 这面墙到底解决了什么单机、单卡、乃至传统集群解决不了的问题?本篇就从这里讲起。

1.1 三股压力把「卡间互联」推上了瓶颈位

要理解超节点,先理解它要解决的痛点。近两年有三股力量,不约而同地把压力压到了「卡与卡之间怎么连」这件事上。

  • 参数量爆炸:稠密大模型动辄数千亿参数,MoE 模型已冲向万亿乃至数万亿(2025—2026 业界已出现 2.8 万亿级模型,并有向 3 万亿、6 万亿演进的判断)。以 BF16 存一份权重,671B 参数要约 1.3 TB 显存,而单张旗舰卡显存只有约 192 GB(HBM3e,2024—2025 量级)。一张卡连模型都放不下,必须把模型切开摊到多张卡上(模型并行),而切开就意味着卡与卡之间要频繁交换中间结果。
  • MoE(混合专家):MoE 把一个大网络拆成很多「专家」,每个 token 只激活其中少数几个。好处是省算力,代价是每一层都要做一次全局的 token 路由(all-to-all 通信)——把 token 发到它该去的专家所在的卡上,算完再收回来。专家分散在越多卡上,这个 all-to-all 就越吃互联带宽和延迟。
  • 长上下文推理 + KV Cache:上下文从几千 token 涨到几十万甚至上百万(Agent 场景一个复杂任务的调用可达几十万次),推理时每个 token 的 Key/Value 都要缓存下来(KV Cache),显存占用随上下文长度线性增长。长上下文场景下,KV Cache 本身就能吃掉几十上百 GB 显存,单卡装不下,就得把它摊到多卡的显存池里。

这三件事的共同点:计算越来越依赖「卡之间高频、大量地交换数据」。 于是「卡间互联」从一个次要指标,变成了决定系统性能的主瓶颈。业界把这归纳为超节点要翻的「三堵墙」——通信墙、功耗散热墙、复杂度墙(中国信通院《超节点发展报告》,2025)。

1.2 Scale-out 的墙:网络比总线慢一个量级

传统做法是 Scale-out(横向扩展):买很多台「8 卡服务器」,用网络(InfiniBand 或 RoCE 以太网)把它们连成集群。这条路能把规模堆到上万卡,但有个绕不过的物理事实:

同一台机器内,8 张卡通过 NVLink 这类总线互联,带宽是 TB/s 级、延迟亚微秒;一旦跨出这台机器走网络,带宽掉到 100~800 Gb/s/卡(约 0.1 TB/s 量级),延迟涨到微秒甚至几十微秒。

这中间差了大约一个数量级。打个比方:机器内部像在同一栋楼里面对面递纸条,跨机器则像把纸条装进快递、跨城寄送——能到,但慢得多,也更不确定。

对 MoE 的 all-to-all、对张量并行里频繁的 all-reduce 来说,这种「跨机断崖」是致命的:只要并行策略里有一步需要高频跨机通信,整个系统的有效算力就会被网络拖垮(GPU 算得飞快,却大把时间在等数据)。有个常被引用的说法:传统模式下 10 台机器的算力相加「只能等于 6」——损耗就出在跨机通信上。

1.3 本质:把「紧耦合域」做大

既然机器内部快、跨机器慢,一个很自然的想法就是:能不能把「机器内部那个又快又全互联的域」做大? 从 8 卡做到 72 卡、384 卡乃至上千卡,让原本必须跨机的高频通信,尽量留在这个「又快又全互联」的域里面完成。

这就是 Scale-up(纵向扩展) 的思路,也是超节点的本质——

超节点 = 把 Scale-up 域从「8 卡一台机」放大到「几十上百卡一个柜(甚至多柜)」,让这些卡在软件看来近似于「一台拥有超大显存池的巨型加速器」。

Scale-up 纵向扩展 vs Scale-out 横向扩展

注意:超节点不是取代 Scale-out,而是把 Scale-up 这一层加厚。 真实的大集群是「超节点(Scale-up 域)作为基本单元,再用网络 Scale-out 成上万卡乃至数十万卡」的两层结构。华为给出的极端例子是 Atlas 950 SuperCluster:由 64 个 Atlas 950 超节点互联,把 52 万多片昇腾组成一个集群(HC2025 发布,计划 2026 Q4)。


2. 核心概念与定义:超节点到底指什么

2.1 和「机柜 / 集群」的边界

容易混淆的三个词,边界在于卡与卡之间是怎么连的:

  • 传统服务器 / 机柜:一个机柜里塞很多台独立服务器,服务器之间靠普通网络连接。机柜只是物理容纳单位,柜内不同服务器的卡并不紧耦合。
  • 集群(Cluster):很多节点通过网络(IB/以太网)连成一片,规模可以极大,但节点之间是松耦合——带宽低、延迟高。
  • 超节点(Super Node):一个机柜或多个机柜内的几十上百上千张卡,通过专用高速总线 + 交换芯片全互联,对软件呈现为一个紧耦合的大加速域。关键不在「物理上是不是一个柜」,而在柜内的卡是不是高带宽、低延迟、全互联地连在一起、且显存统一编址。

一句话区分:机柜看物理边界,集群看规模,超节点看「柜内卡间是否紧耦合」。

超节点是什么:一台逻辑上的超级计算机 + 五个衡量维度

2.2 为什么要做超节点:一笔「总体效能账」

超节点整机比同样卡数的普通服务器总价更贵,为什么大厂还抢着部署?因为客户算的不是「卡的单价」,而是总体效能账:

  • 把通信损耗降到最低:高速互联让「10 台机器算力只等于 6」的损耗被大幅收回,更多算力真正用于计算。
  • 单位 Token 成本下降:用超节点做 PD 分离推理,相比同卡数普通机器可提升 30%~50% 的性能(昆仑芯、新华三等厂商公开说法,2025—2026)。
  • 基础设施更集约:风火水电、机房、运维统一规划,密度更高。「推理性能提升 10 倍、耗电可能只提升 2 倍」,算下来是划算的(浪潮信息公开举例)。

一句话:超节点的价值不在「卡更多」,而在「让每张卡的算力真正发挥出来」,从而降低单位 Token 成本。 这也是为什么推理占比越来越高(线上推理:训练已接近 5:1~10:1,2026 阿里云口径)时,超节点的大内存池、高带宽互联尤其吃香。

2.3 衡量一个超节点的五把尺子

判断一个方案是不是「真超节点」、以及它强在哪,就看这五个维度:

  1. 域内卡数(domain size):一个全互联域里有多少张卡。最直观:8(传统单机)→ 72(NVL72)→ 384(CloudMatrix 384)→ 1024/8192(昇腾 Atlas 950)。域越大,越多高频通信能留在域内。
  2. 互联带宽:分「每卡带宽」和「机柜/系统聚合带宽」。每卡 TB/s 级,整系统聚合可达上百 TB/s 甚至 PB/s 级。带宽决定「数据搬得多快」。
  3. 互联延迟:域内通常是亚微秒级(如昇腾 950 超节点宣称 3μs 级 RTT、信通院定义要求交换时延 <500 ns),比跨机网络(微秒~几十微秒)低一个量级。延迟决定「一次同步要等多久」。
  4. 是否全互联(all-to-all / 无阻塞):任意两张卡能不能同时跑满带宽,而不是共享一条总线互相抢。全互联是 MoE all-to-all、大规模张量并行的前提。
  5. 显存是否统一寻址:一张卡能不能像访问自己显存一样,直接 load/store 另一张卡的显存(即「显存池化 / UB Memory」)。这决定了超节点能不能真正当「一台大显存机器」用。信通院定义明确要求「域内 AI 芯片支持内存统一编址,可用内存语义直接访问其他 AI 芯片的内存」。

抓重点:别只盯「卡数」这一个数字。一个卡多但带宽低、延迟高、半互联的方案,实战效果可能不如一个卡少但全互联、低延迟、统一寻址的方案。超节点比的是「紧耦合的质量 × 规模」,不是单纯堆卡。

2.4 容易被忽略的几个维度:代际、Chiplet、精度、CCU、编程模型

除了上面五把尺子,评估超节点还要看支撑它的芯片与软件维度:

  • 架构代际:芯片一年一迭代,直接决定单卡算力与互联带宽上限。以昇腾路线为例(华金证券整理 HC2025 公开信息,2026):Ascend 950 系列互联带宽 2 TB/s、970 提升到 4 TB/s;FP8 算力从 950 的 1 PFLOPS 到 960 的 2 PFLOPS、970 的 4 PFLOPS。NVIDIA 侧则是 Hopper→Blackwell→Rubin 的逐代翻倍。
  • Chiplet(芯粒)封装:先进制程受限或为提升良率/算力时,用多个 die「拼」成一颗大芯片。昇腾 910C 即用 3D Fabric 封装实现 Die-to-Die 500 GB/s(2025);NVIDIA Blackwell 也是双 die 封装。Chiplet 是「单颗芯片算力」继续增长的关键手段之一。
  • FP8 / FP4 低精度算力:超节点标称算力常用 FP8/FP4。精度越低、同样硅面积能堆的算力越多,但对数值稳定性和软件支持要求更高。看算力一定要看清精度口径(FP8/FP4、稠密/稀疏差好几倍)。
  • 内存技术与 UB Memory:HBM 容量/带宽决定「装得下、喂得快」;而「UB Memory」这类机制让多卡 HBM 在域内统一编址成一个大池——这是显存池化的落地形态。
  • CCU(通信/加速单元):把集合通信(all-reduce/all-to-all)等从主计算核卸载到专门单元,减少通信对算力的挤占,是提升大域效率的工程手段。
  • 编程模型:域再大,程序员要能用得上才有意义。NVIDIA 靠 CUDA/NCCL,华为靠 CANN/MindSpore(并提供对 CUDA 代码的转换与 PyTorch 兼容)。编程模型的成熟度,往往比硬件参数更能决定实际可用性。

2.5 厂商协议大乱斗:Scale-up 这一层谁说了算

超节点最核心的「地盘」是 Scale-up 互联协议——它直接决定性能上限,也决定下游生态被谁绑定。于是这一层出现了「私有 vs 开放」的大乱斗。

厂商协议大乱斗:私有总线 vs 开放标准

  • 私有总线(性能领先、绑生态):NVIDIA 的 NVLink/NVSwitch(绑 CUDA/NCCL,事实标准);华为的 灵衢 UnifiedBus(UB),以及把 UB 承载到以太网的 UBoE(相比传统 RoCE,静态时延更低、可靠性更高、省交换机和光模块,华为推荐组网方式);还有阿里 ICN、清微直连等各家自研。特征是性能可冲顶,但彼此不互通、下游被锁定。
  • 开放标准(互通、聚合生态,追赶中):UALink(Ultra Accelerator Link,1.0 规格 2025 发布,目标单 pod 千卡级 Scale-up)、Scale-up 以太(SUE 等),试图打破私有总线垄断;PCIe/CXL 通用但带宽延迟不够,多用于 CPU-设备与内存扩展,非主力 Scale-up。
  • 一条「及格线」:信通院《超节点发展报告》(2025)给出定义——≥32 卡、AI 芯片↔交换芯片带宽 ≥400 GB/s、交换时延 <500 ns、域内统一内存编址。达不到就不算严格意义的超节点。

为什么会乱斗:谁掌握 Scale-up 互联,谁就掌握性能上限和生态入口。私有总线性能领先但互不兼容,下游怕被锁死,于是推动开放标准;而开放标准能否在性能与成熟度上追上私有总线,是未来几年的胜负手。值得注意的是,华为选择开放灵衢规范,试图用「开放」聚合国产产业链合力——这与「私有封闭」是两种不同的生态打法。

2.6 架构范式之争:主从架构 vs 对等架构(Peer-to-Peer)

超节点内部,几十上百张卡「谁来指挥、谁来发起通信、谁来管显存」,有两种根本不同的组织方式,这也是传统服务器与超节点最本质的分野之一。

  • 主从架构(Master-Slave,传统 8 卡服务器的典型形态):有一个中心 CPU/主控负责调度,GPU 之间要通信,往往需要经 CPU 发起、经 PCIe 中转,或由 CPU 统一管理数据搬运。好处是模型简单、控制集中;坏处是中心主控成了瓶颈与单点——GPU 想直接找另一张 GPU,还得先「打报告」给 CPU,跨卡 all-to-all 规模一大就卡在主控和 PCIe 上。
  • 对等架构(Peer-to-Peer,超节点的主流取向):所有加速卡地位平等,任意一张卡都能自己发起对其他卡显存的直接读写(load/store / RDMA 直读),不必经过中心 CPU。华为把 CloudMatrix 384 的互联描述为「全对等(peer-to-peer)互联」正是此意。好处是去掉了主控瓶颈,all-to-all、专家路由这类「人人对人人」的通信可以直接在卡间铺开;代价是硬件(统一编址、一致性、交换芯片)和软件(通信库、调度)都要更复杂。

类比:主从架构像一个「必须所有事都经组长转达」的小组——组长一忙,全组停摆;对等架构像一个「人人可以直接找人人」的扁平团队——沟通高效,但要靠一套清晰的协作规则(协议)避免乱套。

为什么超节点必然走向对等:MoE 的 all-to-all、大规模 TP 的 all-reduce,本质都是「人人对人人」的高频通信。若每一步都要经中心主控中转,主控和 PCIe 立刻成为瓶颈,域根本做不大。因此只有对等架构,才能把 Scale-up 域扩到几十上百上千卡。这也顺带改变了「故障域」:对等架构下,单卡故障不必拖垮中心主控,但也要求更强的分布式故障定位与恢复能力(见下篇「可靠性工程」)。


3. 关键使能技术:超节点靠什么「粘」起来

把上百张卡粘成一台机器,要同时解决三个问题:怎么连得快(互联)、怎么共享显存(池化 + 一致性)、怎么喂得起电散得了热(供电散热)。 三者缺一不可。

三大使能技术:互联 / 池化 / 散热供电

3.1 高速互联总线:NVLink/NVSwitch 与华为灵衢(UB)

为什么不用 PCIe? CPU 和 GPU 之间走的 PCIe,Gen5 x16 双向约 128 GB/s(2024 量级),对多卡高频通信远远不够。于是各家都搞了私有高速总线,专门用于卡间直连,带宽比 PCIe 高一个量级。

  • NVLink(点对点总线):GPU 之间的专用高速通道。到 Blackwell(NVLink 5,2024)每卡双向约 1.8 TB/s,是同代 PCIe Gen5 的十几倍。它解决「两张卡之间怎么连得快」。
  • NVSwitch(交换芯片):光有点对点还不够——72 张卡两两直连要 N² 条线,物理上不现实。NVSwitch 像一个「卡间的交换机」,把所有卡接到交换芯片上,让任意两卡都能以 NVLink 全带宽通信(全互联、无阻塞)。NVL72 用 9 个 NVSwitch 托盘,把 72 张卡的聚合互联带宽做到约 130 TB/s(2024 规格)。
  • 华为灵衢(UnifiedBus,UB):华为的对位方案,是 CloudMatrix 384 乃至 Atlas 950 的互联底座。它采用单层扁平全互联拓扑,让数百上千张卡在一个域内全互联。CloudMatrix 384 卡间带宽约 2.8 Tbps(≈0.35 TB/s,2025 公开数据);Atlas 950 超节点标称系统互联带宽达 16.3 PB/s(HC2025,满配 8192 卡口径)。

类比:NVLink 是「两户之间的专用高速公路」,NVSwitch 是「一个巨大的立交枢纽」,让任意两户之间都能走高速直达,而不用绕路或排队。

铜缆 vs 光互联:一场关于「距离、功耗、可靠性」的取舍。 这是超节点工程里最核心的物理取舍之一,直接决定了「域能做多大」。

  • 铜缆(NVL72 的选择):用铜线背板(NVLink Spine)把卡连起来。优点:功耗低、成本低、极其稳定可靠。致命缺点:高速信号在铜缆上只能传约 2 米(端口速率越高,衰减越狠,224 Gbps 时甚至 3 米内严重衰减),这就把全互联域锁死在一个机柜内——72 卡几乎是铜缆方案塞进单柜的上限。
  • 光互联(CloudMatrix 384 / 昇腾 950 的选择):用光模块把电信号转成光,用光纤传。优点:传输距离远、损耗低,于是可以跨多个机柜连成一个大域——这正是华为能做到 384 卡、1024 卡乃至 8192 卡的物理前提。代价:光模块成本成倍、功耗大幅增加、光纤/光模块更脆弱(插口松动、光纤弯折、端面有灰都可能断连)。CloudMatrix 384 用了约 6912 个 400G 光模块(2025 数据),光这一项的成本、功耗和故障率就是巨大的工程挑战。

这解释了一个常被误解的点:华为选光、NVIDIA 选铜,不是谁更先进,而是不同约束下的不同解。 NVIDIA 单卡强,用铜缆把 72 卡做到极致省电稳定就够打;华为单卡有代差,只能靠「更大的域 + 更多的卡」在系统层面扳回来,而更大的域必须突破 2 米限制,于是非光不可。NVIDIA 自己在 2022 年也评估过用光连 256 张 H100,最终因成本和稳定性放弃——可见这条路不好走,华为是靠长期的光通信积累才啃下来的。

演进方向:业界正从传统可插拔光模块(FRO)走向 LPO(线性直驱)→ NPO(近封装光学)→ CPO(共封装光学),核心思路都是「把光引擎越做越贴近芯片」,缩短光电距离、降功耗、提带宽密度。壁仞、曦智等正主推 NPO,博通/英伟达/台积电押注 CPO。

3.2 互联形态对比:Switch-based vs Switchless

把卡连起来,有两种根本形态——要不要一块独立的交换芯片。

  • Switch-based(集中交换,NVL72 / CloudMatrix 384 的选择):卡都接到独立的交换芯片(NVSwitch、UB Switch)上,任意两卡经交换芯片一跳可达。优点:天然全互联、无阻塞,任意两卡等距、带宽一致,布线规整。代价:交换芯片本身是额外的硅成本、功耗与潜在故障点;规模越大,交换容量要求越高。
  • Switchless(直连组网:mesh / torus / ring,清微可重构数据流是极端代表):没有独立交换芯片,卡与卡直接相连,数据靠「邻居转发」到达远端。清微的做法是「每颗芯片既算又转发」。优点:省掉交换芯片的成本与功耗,布局灵活。代价:非相邻两卡要多跳转发,跳数越多延迟越高、带宽越可能被中间链路挤占;拓扑一旦某条链路坏了,路由要重算,故障域更复杂。

类比:Switch-based 像城市里的「环形立交 + 中央枢纽」,谁去谁家都走枢纽、一跳直达;Switchless 像「棋盘式街道」,没有立交,去远处要连过好几个路口——省了建枢纽的钱,但远距离通勤要绕、要等红灯。

怎么选:追求「任意两卡等距、低时延、全互联」就上 Switch-based(主流超节点);追求「省成本、规模灵活、可用非相邻通信为主的负载」才考虑 Switchless。一个经验判断:domain 越大、all-to-all 越重,越偏向 Switch-based;否则多跳的尾延迟会吃掉规模收益。

3.3 拓扑 × 通信协同:集合通信与互联拓扑的联合优化

超节点的互联拓扑,直接决定了集合通信(AllReduce/AllGather/All-to-All)该用什么算法,二者必须协同设计,否则再高的物理带宽也打不满。

  • AllReduce(TP/DP 梯度与激活同步最常用):在 ring 拓扑上用 Ring-AllReduce(带宽最优但跳数多、延迟高),在全互联/交换拓扑上可用 tree/递归折半(延迟更低)。拓扑不同,最优算法不同。
  • All-to-All(MoE 专家路由):最吃「任意两卡同时跑满带宽」的能力,只有全互联、无阻塞的拓扑才能让它不塌;在多跳拓扑上,all-to-all 会因链路争用而急剧劣化。
  • 软硬协同的目标是「把通信藏进计算」:通过算法选择 + 通信/计算 overlap(边算边传)+ CCU 卸载,让通信时间被计算掩盖,而不是让 GPU 停下来干等。这也是为什么同样的卡数和带宽,不同框架/通信库跑出的实际吞吐能差一大截。

一句话:拓扑是「路网」,集合通信算法是「调度策略」,两者匹配,带宽才能真正变成吞吐。 超节点的价值,一半在硬件把路修宽,一半在软件把车调顺。

在「开放 Scale-up 互联」这条赛道上,有两条主要路线正在竞争,它们都想替代/补充 NVLink 这类私有总线。

  • UALink(Ultra Accelerator Link):由 AMD、博通、Intel、Google 等组成的联盟推动,1.0 规格 2025 年发布,专为加速器 Scale-up 设计,走「内存语义、低延迟、原生 load/store」路线,目标单 pod 互联到千卡级。定位接近「开放版 NVLink」。
  • SUE(Scale-Up Ethernet):以博通为代表,主张复用成熟的以太网生态来做 Scale-up,把以太网的规模化、供应链优势带进来。华为的 UBoE(UB over Ethernet) 思路类似——把自家 UB 协议承载到以太网上,让客户能用现有以太交换机,相比传统 RoCE 静态时延更低、省光模块。
  • 差异:UALink 更「专用、极致低延迟」,SUE/UBoE 更「借力以太生态、易规模化落地」。前者赌「专用协议性能更优」,后者赌「生态和成本更重要」。

为什么有这场之争:Scale-up 这一层既要极低延迟 + 内存语义(偏专用协议),又要低成本 + 大规模供应链(偏以太网)。两个诉求有张力,于是分成两派。短期看专用协议性能领先,长期看谁能把「性能」与「生态成本」平衡好,谁才能成为开放标准的赢家。

3.5 通信语义:消息语义(send/recv)vs 内存语义(load/store)

卡与卡之间「怎么表达一次通信」,有两种模型,这是超节点区别于传统网络集群的关键一跳。

  • 消息语义(Message Passing,send/recv):传统 MPI/NCCL 的方式,一方「发消息」、另一方「收消息」,需要两端协调、打包拆包。编程直观、与网络天然契合,但每次通信有软件栈开销,延迟较高,适合粗粒度、规整的集合通信。
  • 内存语义(Memory Semantics,load/store、RDMA 直读远端):一张卡像访问本地内存一样直接读写远端卡的显存,不需要对端 CPU/软件参与。延迟极低、细粒度、省去打包协调,是显存池化、统一编址的落地形态;代价是对硬件(统一地址空间、一致性)要求高,且编程时要自己管好同步与一致性。

类比:消息语义像「寄快递」——要打包、填单、对方签收;内存语义像「直接伸手到对方抽屉里拿东西」——快,但你得清楚东西放哪、会不会和对方同时动到同一样。

超节点为何偏向内存语义:MoE/长上下文下有大量细粒度、随机、低延迟的跨卡访存(如跨卡读 KV),用消息语义每次都打包协调太贵。内存语义 + 统一编址才能让「几十上百张卡像一台大显存机器」这个假象成立。这也是信通院把「内存语义直接访问其他 AI 芯片内存」写进超节点定义的原因。

3.6 保序模型:源端保序 vs 目的端保序

高带宽互联常把一股数据拆到多条物理路径上并行传(多路径负载均衡),于是产生一个问题:数据包可能乱序到达,在哪里把顺序恢复?

  • 源端保序:发送端保证按序发出、甚至限制只走单路径,接收端收到就是有序的。实现简单,但限制了多路径并行——为了保序牺牲了带宽,还容易被单条慢路径拖成「尾延迟」。
  • 目的端保序:允许多路径乱序传输,由接收端负责重排。能充分利用多路径、把带宽打满,对单条链路抖动更鲁棒(尾延迟更可控),代价是接收端要有重排缓冲和逻辑。

为什么超节点倾向目的端保序:超节点要在多路径上把 TB/s 级带宽打满,源端保序等于自废武功。目的端保序让负载均衡自由铺开、尾延迟可控,更契合「高带宽、低尾延迟」的 Scale-up 诉求——代价是硬件复杂度,但这正是专用互联协议愿意付的成本。

3.7 显存/内存池化与统一编址

超节点最诱人的能力,是把 N 张卡的显存合成一个大池子。

  • 显存池化:72 张卡每张约 192 GB,物理上是 72 块独立显存,但通过高速互联 + 统一编址,软件可以把它们当作一个约 13.4 TB(NVL72,2024 量级)的大显存来用;华为昇腾 Atlas 950 这类更大的域,官方宣称全局统一内存编址空间可达 256 TB(1024 卡真机口径)乃至满配 1152 TB(8192 卡口径,HC2025)。价值:一个单卡放不下的万亿参数模型,或一份巨大的 KV Cache,可以摊在整个池子里,而不用频繁往 CPU 内存甚至硬盘 offload(那会慢几个数量级)。
  • 统一编址(Unified Addressing / UB Memory):让「卡 A 直接读写卡 B 的显存」变得像访问本地显存一样,用普通的 load/store 指令完成,而不用程序员手动写「从 B 拷到 A」的通信代码。

类比:没有池化时,一堆卡像一群人各管各的笔记本,要用别人的数据得开口要、等对方递过来(显式通信);池化 + 统一编址后,更像大家共用一个巨大的共享文档,谁都能直接翻到任意一页(直接访存)——虽然翻到「别人那一页」还是比翻「自己那一页」慢一点。

3.8 超节点的访存体系:一个「有层次的大内存」

「逻辑上一台机器」这个假象,靠的是一套多级存储层次撑起来的,离卡越近越快越贵越小:

  • 本地 HBM(最快):卡自己的显存,TB/s 级带宽、纳秒级延迟,放最热的数据(当前激活、正在算的权重)。
  • 域内远端 HBM / UB Memory(池化层):通过统一编址直接访问同一超节点内其他卡的显存。比本地慢一点(多一次跨卡互联的延迟),但仍远快于走网络或落盘,是「大显存池」的主体。
  • 池化内存 / 主机内存(更大更慢):CPU 侧 DRAM 或专门的池化内存,容量大、带宽和延迟都更差,做溢出缓冲与冷数据。
  • 本地 SSD / 分布式存储(最大最慢):KV Cache 多级缓存的最底层、Checkpoint 落盘等。

关键在于远端访存延迟这个新变量:统一编址让「跨卡读」变得透明,但它不是零成本——跨卡读比读本地 HBM 慢。所以软件要有「亲和性」意识:把最热的数据尽量留在本地 HBM,把跨卡访存留给没那么热、但又装不下的数据(如摊开的 KV Cache / 大权重分片)。

一句话:超节点的访存体系,是用「本地 HBM 快 + 域内池化大 + 落盘兜底」的层次,换来「看起来像一台超大显存机器」的假象。用好它的前提是承认「远端≠本地」,并据此安排数据亲和性。

3.9 Cache 一致性:共享带来的新麻烦

一旦多张卡能直接读写同一片「逻辑显存」,就冒出一个经典难题:如果卡 A 和卡 B 都缓存了同一个数据,A 改了,B 手里的还是旧的,怎么办? 这就是 Cache 一致性(Cache Coherence) 问题。

  • 硬件一致性:由硬件协议自动保证「谁改了,其他人立刻看到最新值」。对程序员透明、好写,但协议开销随域变大而急剧上升——要跟踪谁缓存了什么、改了就通知所有人,域越大,这个「通知」的流量和延迟越夸张。
  • 软件/弱一致性:硬件只保证基础的数据可达,一致性靠软件(框架、通信库)在该同步的地方显式同步。写起来更麻烦,但扩展性好,不会被一致性协议拖死。

类比:Cache 一致性就像多人同时编辑一份文档。「硬件强一致」是每敲一个字就实时同步给所有人看——体验好,但人一多,同步流量就爆炸;「软件弱一致」是各自编辑、到某个检查点再手动合并——麻烦,但人再多也扛得住。

工程取舍:超节点的域越大,越倾向于不做全域硬件强一致,而是在域内做适度一致、靠软件在关键点同步。这也是为什么「统一寻址」不等于「强一致共享内存」——能直接访问,不代表时时刻刻自动帮你保持最新。

3.10 供电与散热:为什么超节点几乎必然走向液冷

把这么多卡塞进一两个柜里,带来一个躲不掉的物理后果:功率密度爆表。

  • 传统服务器机柜功率通常几千瓦到十几千瓦;AI 超节点单柜可达 100 kW 甚至更高。NVL72 整柜约 120 kW(2024),CloudMatrix 384 整系统约 559 kW(SemiAnalysis 测算,2025)。
  • 风冷的物理极限:当单卡功耗冲到 1000W 以上(Blackwell 单卡约 1200W,2024 量级),靠风把热吹走已经力不从心——风的比热容和导热能力有限,高密度下根本来不及散热。
  • 液冷成为前提:液体的导热能力远强于空气,冷板式液冷让冷媒直接接触发热部件,散热效率比风冷大幅提升(华为云数据中心用冷板液冷把散热效率较风冷提升约 50%,PUE 做到 1.12,2025)。所以高端超节点几乎必然上液冷——不是为了「高级」,而是风冷物理上扛不住。中科曙光更进一步用浸没式液冷支撑单柜 640 卡的高密度。

「功耗墙」的本质:芯片堆得越密、算力越强,单位体积发热越多;散热跟不上就得降频,降频就等于算力打折。散热不是配角,而是决定超节点能不能跑满、能不能长期稳定的硬约束。 一个有意思的侧面:功耗在不同地区的权重不同——SemiAnalysis(2025)指出,在电力相对充裕的环境里,用更高功耗换更大扩展性是划算的,这也部分解释了国内方案敢于「以功耗换规模」。


小结与下篇预告

上篇我们讲清了三件事:

  • 为什么:大模型、MoE、长上下文把压力压到「卡间互联」,而 Scale-out 跨机网络比总线慢一个量级,必须把紧耦合域(Scale-up)做大。
  • 是什么:超节点是「几十上百上千张卡经高速总线 + 全互联 + 统一编址,粘成的一个紧耦合大加速域」;用五把尺子(卡数/带宽/延迟/全互联/统一寻址)衡量,并要看代际、Chiplet、精度、CCU、编程模型,以及背后私有 vs 开放的协议大乱斗、主从 vs 对等的架构范式之争。
  • 靠什么:互联形态与拓扑(NVLink/NVSwitch、灵衢 UB,铜 vs 光,Switch-based vs Switchless,拓扑 × 集合通信协同)+ 通信语义与协议(SUE vs UALink,消息 vs 内存语义,源端 vs 目的端保序)+ 存储与散热(显存池化与统一编址、多级访存体系、Cache 一致性、液冷散热)——缺一不可。

下篇将进入「谁在做、往哪走」:详解 NVIDIA GB200 NVL72 与华为 CloudMatrix 384 的路线之争,盘点国产超节点厂商图谱(华为、阿里、百度、中科曙光、浪潮、沐曦、壁仞、摩尔线程、清微等)的三条路线,分析超节点如何改变 TP/EP/PP 并行策略与 KV Cache 显存压力,最后讨论 Scale-up 的物理极限、互联成本、国产生态挑战与光互联/更大 domain/软硬协同的演进方向。