超节点(Super Node / SuperPod)深度科普(下):谁在做、怎么对比、往哪走

NVL72 vs CloudMatrix 384 路线之争、国产厂商图谱三条路线、TP/EP/DP/算子/KV 存储/训推画像的全套取舍与未来趋势

Posted by tanjunchen on Saturday, October 3, 2026  ·  阅读  ·   ·  预计阅读约 17 分钟

承上启下

上篇讲清了超节点的为什么(卡间互联成瓶颈、Scale-out 跨机慢一个量级)、是什么(把 Scale-up 域做大的紧耦合加速域,五把尺子 + 协议大乱斗)、靠什么(互联/池化/散热三大使能技术)。下篇接着回答谁在做、怎么对比、往哪走。

若还没看过上篇《超节点深度科普(上):为什么出现、是什么、靠什么实现》,建议先读,再看本篇的产品对比与应用分析。数据口径同上篇:NVIDIA 来自官方规格(2024-03),华为来自发布会 + HC2025(2025-09)+ WAIC2026 + SemiAnalysis(2025),各家口径不完全一致,以最新发布为准。


4. 代表性产品与方案对比

4.1 NVIDIA GB200 NVL72(铜缆路线,2024-03 发布)

GB200 NVL72 与 CloudMatrix 384 路线对比

  • 互联规模:72 张 Blackwell GPU + 36 Grace CPU,组成一个全互联域(单机柜)。
  • 拓扑:18 个计算托盘(每托盘 2 个 GB200 超级芯片 = 4 GPU + 2 Grace)+ 9 个 NVSwitch 托盘,通过铜缆背板(NVLink Spine)把 72 卡全互联。可以在脑中想象成:72 张卡接到 9 块交换芯片上,任意两卡都能走交换芯片全带宽直达。
  • 带宽:NVLink5 每卡双向 1.8 TB/s,机柜聚合约 130 TB/s;HBM3e 显存约 13.4 TB、显存带宽约 576 TB/s。
  • 算力:FP4 约 1.4 EFLOPS(含稀疏)、BF16 约 180 PFLOPS 量级。
  • 功耗:整柜约 120 kW,液冷。
  • 生态成熟度:最高。CUDA / NCCL / 主流框架开箱即用,迁移成本几乎为零,是当前事实标准。

NVIDIA 自家也在向更大域演进:Blackwell Ultra GB300 NVL72(2025),路线图上的 Rubin 系列 NVL144(2026)直到 Rubin Ultra 的 NVL576(Kyber 机柜,2027 路线图),域规模从 72 向数百卡扩张。

4.2 华为 CloudMatrix 384(全光路线,2025-04 发布)

  • 互联规模:384 张昇腾 910C,16 个机柜(12 个计算柜 + 4 个交换柜),每个计算柜 32 卡。是当前已商用超节点里单体规模最大之一(Atlas 900 超节点的云上实例,截至 2026 WAIC 已商用落地 750+ 套)。
  • 拓扑:灵衢(UB)单层扁平全互联,全光链路。每张卡配 7 个 400G 光模块,整系统约 6912 个 400G 光模块。可以想象成:384 张卡全部用光纤接到中央 4 个交换柜,靠单层交换实现全互联,没有多级转发带来的额外延迟。
  • 带宽:卡间约 2.8 Tbps(≈0.35 TB/s);HBM 总容量约 49.2 TB、总显存带宽约 1229 TB/s。
  • 算力:BF16 约 300 PFLOPS,约为 NVL72(BF16 约 180 PFLOPS)的 1.7 倍(华为公开数据 + SemiAnalysis 测算,2025)。
  • 功耗:整系统约 559 kW,约为 NVL72 的 4 倍,每 FLOP 功耗高出约 2.3~2.5 倍。
  • 生态成熟度:在补齐。CANN + MindSpore 栈,提供对 CUDA 代码的转换与 PyTorch 兼容;2025 年底完成 CANN 开源,截至 2026 WAIC 开源社区上线 67 个项目、代码超 1244 万行。迁移和调优成本仍明显高于 CUDA 生态。

中立评价:SemiAnalysis(2025)的判断值得引用——华为单芯片落后约一代,但 Scale-up(系统级扩展)方案领先一代。CloudMatrix 384 用「更多卡 + 更大域 + 全光互联」在系统层面追平甚至在部分指标超越 NVL72,代价是显著更高的功耗和成本。这是一次典型的「以功耗/成本换规模和自主可控」的工程取舍,没有绝对优劣,取决于约束条件(电价、供应链、生态迁移成本)。

4.3 国产超节点厂商图谱:三条路线

2026 年被业界视为「国产超节点商用元年」——26Q2 以来华为、阿里、百度、浪潮、中兴、沐曦、壁仞、摩尔线程、清微等密集发布。观察下来大致形成三条路线。

国产超节点厂商图谱:三条路线

路线一 · 不断做大 domain(越大越好)

  • 华为 昇腾 Atlas / CloudMatrix:Atlas 900=384 卡(已商用 750+ 套);HC2025 发布 Atlas 950=8192 卡(160 机柜、占地约 1000㎡、全光互联,FP8 算力 8 EFLOPS、FP4 16 EFLOPS、互联带宽 16.3 PB/s,计划 2026 Q4)、Atlas 960=15488 卡(计划 2027 Q4);WAIC2026 已展出 1024 卡真机,是目前业界公开最大规模超节点。
  • 中科曙光 曙光8000(登峰):浸没式液冷,单机柜 640 卡,构建的十万卡 AI 超集群已落地国家超算互联网郑州核心节点。
  • 百度智能云 昆仑芯 / 天池:天池 256 已落地、天池 512 规划年底推出,强调从互联协议、交换芯片到液冷系统的全栈自研,已交付多个万卡集群(文心大模型重要版本在全国产集群完成训练)。

路线二 · 效率与经济性(够用就好)

  • 阿里云 磐久 / 真武 M890:磐久 AL128 单柜 128~144 卡、350 kW 供电、全方位解耦;以 64 卡为 Scale-up 单元、再 Scale-out 扩展,兼容多元 GPU,并把这种算力形态放上公共云按需调用。
  • 浪潮信息 元脑 SD200:面向万亿参数推理,从 64 卡再推 32 卡产品,主打「让更多企业用得起」。
  • 沐曦 曦景 S 系列:单柜 64 卡为基础,强调 CUDA 生态兼容和向万卡横向扩展。

路线三 · 新芯片 / 新互联(重定义超节点)

  • 壁仞科技:NPO(近封装光学)光互连 + 分布式解耦架构,GPU 节点与交换节点物理分离、光纤灵活互连,支持单超节点 1024 卡 Scale-up(联合曦智、中兴推出光跃 LightSphere X)。
  • 摩尔线程 MTT C256:一层 Scale-up 网络实现 256 卡全互联,支持从万卡向十万卡集群扩展。
  • 清微智能:可重构数据流架构,芯片既算又转发、芯片间直连无需交换机,已推 4096 卡、峰值 500 PFLOPS 的超节点。
  • 还有 中兴 OEX(多元 GPU 生态兼容)、新华三 S80000、燧原等。

要点对比(不堆表格):

  • 互联规模:NVL72=72(单柜);CM384=384(16 柜);昇腾 Atlas 950=8192、曙光单柜 640、壁仞/摩尔=1024/256、清微=4096。
  • 互联介质:NVIDIA 铜缆(省电稳定、≤2m、域受限);国产主流全光(可跨柜做大、贵且脆弱)。
  • 拓扑:均追求「全互联、尽量单层/少层」;清微走无交换机直连,壁仞走解耦 + 灵活光纤。
  • 生态成熟度:CUDA 碾压;昇腾 CANN 在快速开源补齐;沐曦等主打 CUDA 兼容降迁移成本。

4.4 超节点配套技术的对比维度

真正评估一个超节点方案,除了「卡数」还要看这些配套维度(给工程选型用的检查清单):

  • 最小 domain 域:能独立工作的最小全互联单元(如 8/32/64 卡)。决定了细粒度部署与故障隔离的粒度。
  • 最大 Scale-up 规模:单个全互联域能扩到多大(72 / 384 / 1024 / 8192 卡)。决定了能把多大的 TP/EP 塞进域内。
  • 计算 Tray(计算托盘):机柜内的基本计算模块(如 NVL72 每托盘 4 GPU + 2 Grace)。影响维护更换与密度。
  • 一层网络 vs 二层网络:单层交换(扁平、低时延,如灵衢单层、摩尔 C256)还是多层交换(可扩更大但多一跳延迟)。层数越少,P2P 时延越低、无阻塞越好做,但单层能连的卡数有上限。
  • 互联带宽:每卡 / 聚合,TB/s ~ PB/s 级。
  • P2P 网络时延:任意两卡点对点通信延迟,亚微秒~几微秒(信通院要求交换时延 <500 ns;昇腾 950 宣称 3μs 级 RTT)。对 TP 这种每步同步的策略,P2P 时延比峰值带宽更关键。

选型口诀:先看「最大 Scale-up 规模能不能装下你最吃通信的那部分并行」,再看「P2P 时延和是否单层全互联」,最后才看聚合带宽和总算力。 卡数是入场券,时延和拓扑质量才是分水岭。


5. 典型应用场景:超节点怎么改变「怎么算」

超节点不只是「更大的机器」,它会改变并行策略的选择。先快速厘清几种并行:

  • TP(张量并行):切「单层内部」的大矩阵,摊到多卡一起算。每步都要 all-reduce 同步,通信最频繁、最吃带宽和延迟,所以 TP 的卡必须待在最快的互联域内。
  • EP(专家并行):MoE 场景,把不同专家放到不同卡,每层做一次 all-to-all 把 token 路由过去。吃全互联带宽。
  • PP(流水线并行):把模型按层切成几段,像流水线一样一段接一段。通信量相对小、能容忍较高延迟,可跨机、跨超节点。
  • DP(数据并行):复制多份模型各算一批数据,只在梯度同步时通信,同样可跨超节点。

超节点如何改变 TP/EP/PP 并行策略的选择

超节点带来的核心变化:域变大后,原本因为「跨机太慢」而不敢大用的 TP 和 EP,现在可以在几十上百上千卡的高速域内展开。

5.1 万亿参数模型训练

万亿参数训练必须三种并行叠加(TP × EP × PP + 数据并行)。超节点的价值在于:把通信最密集的 TP、EP 尽量塞进同一个 Scale-up 域内,让它们享受 TB/s 带宽和亚微秒延迟;只把通信较稀疏的 PP 和 DP 放到跨超节点的网络层。这样 GPU「等数据」的时间大幅减少,有效算力利用率(MFU)显著提升。业界经验:1 万亿参数模型训练约需 5000 卡、3 万亿约 1 万卡、6 万亿约 2 万卡(沐曦 CTO 口径,2026)——卡越多,越需要把它们「算到一起」而非各自为战。

5.2 MoE 专家并行

MoE 的 all-to-all 是超节点的「主场」。专家越多、分布越广,all-to-all 压力越大。在一个 384 卡(乃至上千卡)的全互联域里,可以把更多专家放进同一个域,让路由通信不出域——这是 CloudMatrix 384 这类大域方案主打 MoE 推理/训练的直接原因。域越大,能容纳的「专家并行度」越高,而不被跨机通信拖垮。

5.3 长上下文推理与 KV Cache 显存压力

长上下文推理的瓶颈往往不是算力,而是显存——KV Cache 随上下文长度线性膨胀,单卡放不下。超节点的显存池化正好对症:把巨大的 KV Cache 摊到整个域的大显存池里(如 NVL72 的约 13.4 TB、CM384 的约 49.2 TB、昇腾 950 超节点的 256 TB 统一编址空间),避免频繁往 CPU 内存/SSD offload(那会让解码速度掉几个数量级)。

同时,推理的 Decode 阶段是访存密集(memory-bound)的——瓶颈在「读 KV 读得多快」。超节点的高带宽互联,让「跨卡读 KV」的代价大幅降低,使得「把 KV 摊到多卡、再跨卡读」在性能上变得可行。配合 PD 分离(Prefill/Decode 分离部署),超节点相比同卡数普通机器可提升 30%~50% 的推理性能(厂商口径,2026)。

一句话串起来:超节点让「通信最贵的那部分并行(TP/EP)和显存最紧张的那部分数据(KV Cache / 大权重)」都能留在一个又快又大的域内。它改变的不只是规模,而是「什么策略在工程上划算」。

5.4 并行策略之争:张量并行(TP)vs 专家并行(EP)

TP 和 EP 都「吃互联」,但吃法不同,对超节点的要求也不同。

  • TP 的通信画像:高频 AllReduce。把一层的大矩阵切到多卡,每一层前向/反向都要做 AllReduce 把部分结果合起来。特点是次数极多、每次数据量中等、对延迟极敏感——因为它卡在计算的关键路径上,一次同步慢,整层就得等。所以 TP 的卡必须最紧耦合(同一超节点、低 P2P 时延)。
  • EP 的通信画像:全局 All-to-All。MoE 每层把 token 路由到对应专家所在的卡,一次 All-to-All、数据量大、对聚合带宽敏感,且流量模式随 token 分布动态变化(可能负载不均)。EP 要的是大 domain + 全互联无阻塞。

类比:TP 像流水线上「每拧一颗螺丝都要和隔壁工友对一次表」——次数多、要快;EP 像「每轮把一大批零件按型号分发到不同工位再收回」——批量大、要路宽。

大 domain 如何改变取舍:在传统 8 卡机里,TP 一般只敢开到 8(不敢跨机,因为跨机 AllReduce 太慢),EP 更是难以大规模展开。超节点把域做到 72/384/上千卡后,TP 可以开到几十、EP 可以把成百的专家放进同一域,二者都突破了「单机 8 卡」的历史边界——这是超节点对并行策略最直接的解放。

5.5 并行策略之争:数据并行(DP)vs 混合并行(DP+TP+PP+EP)

  • 纯数据并行(DP):每张卡存一份完整模型、各算一批数据,只在反向后做一次梯度 AllReduce。通信稀疏、能容忍延迟,适合跨超节点、跨机。但致命前提是「单卡/单域放得下整个模型」——对万亿模型根本不成立。
  • 混合并行(DP+TP+PP+EP):真实的大模型训练一定是多种并行叠加。关键是分层编排,让每种并行待在「与它通信画像匹配」的那一层:
    • 节点内(超节点域内):放通信最密集的 TP、EP,吃 TB/s 带宽、亚微秒延迟。
    • 节点间(跨超节点,走网络):放通信稀疏的 PP(层间流水)、DP(梯度同步)。

口诀:把通信按「频率 × 延迟敏感度」排序,最敏感的塞进最快的层。 超节点的意义,就是把「最快的那一层」从 8 卡扩到上百上千卡,于是 TP/EP 的可行规模被整体抬高,整机的 MFU(算力利用率)随之上升。

显存/通信开销差异:DP 省通信但费显存(每卡一份模型);TP/PP/EP 省显存但费通信。超节点「大显存池 + 高带宽」正好缓解了混合并行里「显存不够只能加 DP、加了 DP 又费显存」的死结。

5.6 算子映射之争:算子分解 vs 算子融合

并行策略定了「卡怎么分工」,算子层面还有一组取舍:把大算子拆开并行,还是把多个算子融合起来?

  • 算子分解(切分):把一个大算子(如大矩阵乘)切成多块,分到多卡/多核并行算。目的是把并行度拉满,但切分带来跨卡通信与同步开销——切得越碎,通信占比越高。
  • 算子融合(fusion):把多个连续小算子(如 LayerNorm + 激活 + 残差)合成一个 kernel,一次性在片上算完。目的是减少中间结果反复进出显存(省访存带宽)和减少 kernel 启动开销,这对 memory-bound 的推理解码尤其关键。

超节点如何改变这一取舍:超节点有更大的本地/域内显存和更高的带宽,使得:① 更舍得把中间结果留在片上/域内做大范围融合,而不必急着落盘;② 分解时的跨卡通信代价更低,分解可以更激进。所以超节点下,「融合减少访存」与「分解提升并行」这两条优化都能更放开手脚——前提是通信库和编译器(如 CUDA/CANN 的融合算子、通信-计算 overlap)跟得上。

5.7 存储协同之争:KV Cache 中心式存储 vs 分布式存储

长上下文推理下,KV Cache 放哪,是超节点时代的新命题。

  • 中心式(池化)存储:把 KV Cache 集中到一个(逻辑)大池里统一管理。优点:便于跨请求复用前缀(prefix caching)、便于 Prefill/Decode 分离(PD 分离:Prefill 节点算出 KV,传给 Decode 节点读)、负载均衡好做。代价:读取要跨卡/跨节点,延迟和带宽压力集中在池上。
  • 分布式(就近)存储:KV 就近放在产生/使用它的卡上。优点:读取延迟低、省跨节点带宽。代价:复用难(别的请求要用得跨节点捞)、负载可能不均。

超节点怎么用:超节点的「域内统一编址 + 高带宽互联」让「中心式池化」的最大短板(跨卡读太慢)被显著缓解——于是超节点倾向中心式池化 + PD 分离:Prefill 把 KV 写进域内大池,Decode 跨卡高速读。这正是 CloudMatrix 384、昇腾 950(256 TB 统一编址)等大域方案主打长上下文推理的底层逻辑。而在跨超节点的更大尺度上,再辅以多级缓存(HBM→DRAM→SSD→分布式存储)兜底。

5.8 训推资源画像之争:训练 vs 推理的需求差异

同是超节点,服务训练和推理,吃的资源很不一样——理解这点才能解释「为什么推理占比上升后超节点更吃香」。

  • 训练:偏算力(FLOPS)+ 梯度同步带宽。要把 TP/EP/PP/DP 全开,吃峰值算力和 AllReduce 带宽,对单次延迟相对没那么敏感(批量大、可容忍)。
  • 推理:偏显存容量 + KV 访存带宽 + 低延迟。Decode 阶段是 memory-bound,瓶颈在「显存装得下多长上下文」和「读 KV 读得多快」,且对单请求延迟(TPS/TTFT)极敏感。

超节点如何同时服务两类负载:大显存池同时满足训练的「大模型放得下」和推理的「长上下文 KV 装得下」;高带宽互联同时满足训练的「梯度同步」和推理的「跨卡读 KV」;而 PD 分离、动态调频等让同一套硬件能按负载切换画像。正因为线上推理:训练已到 5:1~10:1(2026 阿里云口径),超节点「大内存池 + 高带宽 + 低延迟」的组合,恰好压中了推理这个主战场的痛点。


6. 挑战与未来趋势

6.1 Scale-up 的物理极限

超节点不能无限做大,有几堵实实在在的墙:

  • 距离墙:铜缆 ≤2 米,这是单柜域规模的物理上限;想更大就必须上光,而光带来成本、功耗、可靠性的全面上升。
  • 功耗/散热墙:单柜上百 kW 已逼近数据中心供电和液冷的设计极限,域再大,供电、散热、机房改造的成本非线性飙升。
  • 一致性与延迟墙:域越大,全互联的交换成本(NVSwitch/光模块数量)和一致性协议开销越高;延迟也难以随规模保持亚微秒。
  • 成本墙:全互联是 N² 量级的互联复杂度,光模块、交换芯片、液冷的成本会随域规模超线性增长。一面由 16 台计算柜拼成的超节点真机,造价可达「数亿」量级(WAIC2026 报道)。

6.2 互联成本与可靠性

  • 光模块成本与功耗:CloudMatrix 384 用了约 6912 个 400G 光模块,昇腾 950 规模更大。光模块是成本、功耗、故障的集中点——华为早期甚至要「把每个光模块端面拍照逐个分析」才解决稳定性(华为云内部口径)。
  • 故障常态化与快速恢复:万级处理器规模下,故障成为常态,对自动化运维与 RAS 能力要求极高。华为给超节点配「昇腾云脑」,提出「1 分钟感知、3 分钟定位、10 分钟恢复」目标,并做到大模型训练稳定运行 40 天、互联断点 10 秒级恢复(2025)。

6.3 国产替代的生态挑战

硬件可以靠系统工程追(CloudMatrix 384、Atlas 950 已证明),但生态是更难的仗:

  • 软件栈:CUDA/NCCL 十余年积累的护城河,不是开一个「代码转换工具」就能填平的——算子覆盖、调优经验、框架适配、调试工具链都要时间。好在 CANN 已开源(2025 底),正加速补齐。
  • 互联标准:私有总线(NVLink、灵衢)各自为政,缺乏开放标准会让下游绑死单一厂商。华为选择开放灵衢规范、UALink 等开放标准能否成气候,关系到国产能否形成合力。
  • 可靠性工程:全光互联的故障率、超大域的故障定位与快速恢复,是大域方案绕不开的运维难题。

6.4 演进方向

  • 光互联下沉:从「柜间用光」走向「柜内也用光」乃至「贴着芯片用光」——沿 LPO → NPO → CPO → OIO 的路径,用光替代铜,突破距离墙、把域继续做大。这是让 Scale-up 域规模继续增长的关键使能技术,也是光模块/硅光产业链的核心机会。
  • 更大的 domain:NVIDIA 路线图指向 NVL144(2026)乃至 NVL576(2027),华为指向 8192(2026 Q4)→ 15488(2027 Q4),国产整体向更大域演进。「域」会继续变大,直到被功耗/成本/散热拉住。
  • 软硬协同:硬件把域做大,软件(并行策略、通信库、调度、KV Cache 管理、CCU 卸载)要跟上,才能把大域的理论带宽转化为实际的训练/推理吞吐。未来的竞争力越来越是「芯片 × 互联 × 软件 × 散热供电」的系统级木桶,而非单卡算力。
  • 开放标准化:UALink、Scale-up 以太(含华为 UBoE)等试图把互联这一层标准化、开放化,降低生态绑定——这对整个行业(尤其是追赶者)是重要变量。
  • 形态多样化:除液冷大柜外,也出现「风冷超节点」(如昇腾 Atlas 850E,VCE 相变散热、无需液冷基建改造、单柜 96 卡,2026),让超节点技术能下沉到传统机房。

结语:超节点的本质是「用系统工程对抗物理极限」

回到整个系列的主线:

  • 是什么:把几十上百上千张卡通过高速总线 + 全互联 + 统一编址,粘成一台逻辑上的超级计算机(一个大的 Scale-up 域)。
  • 为什么:大模型、MoE、长上下文把压力压到「卡间互联」,而 Scale-out 的跨机网络比总线慢一个量级,必须把紧耦合域做大。
  • 怎么做:高速互联(NVLink/NVSwitch、灵衢 UB)+ 铜缆/光的取舍 + 显存池化与一致性 + 液冷散热。
  • 谁在做:NVIDIA(NVL72,铜缆、单卡强、生态成熟)与华为(CloudMatrix 384 / Atlas 950,全光、以规模和系统工程补单卡代差),以及阿里、百度、中科曙光、浪潮、沐曦、壁仞、摩尔线程、清微等国产三条路线,加上 UALink 等开放标准。
  • 往哪走:光互联下沉(NPO/CPO)、更大的 domain、软硬协同、开放标准化、形态多样化——同时撞上距离、功耗、一致性、成本四堵墙。

超节点真正的看点,从来不是某个单卡参数,而是在物理极限(距离、功耗、散热、一致性、成本)之内,用系统工程把「紧耦合的质量 × 规模」做到多大。 谁能在这个多维约束下取得更好的平衡,谁就握住了下一阶段 AI 算力的入场券。


参考资料与数据来源

下列为本系列引用的主要公开来源,便于读者自行核对。说明两点:① NVIDIA 规格以官方 GB200 NVL72 Datasheet 为准,本文带宽/算力为其公开值;② 华为 Atlas 950/960、百度天池 512 等未量产产品为官方路线图 / 宣称值,SemiAnalysis 的 CloudMatrix 384 功耗、算力对比为第三方测算,与厂商口径可能存在差异。芯片与系统指标迭代极快,请以厂商最新发布为准。