漫步远方,心荡神往

超节点(Super Node / SuperPod)深度科普(上):为什么出现、是什么、靠什么实现

从 WAIC 2026 的一面「墙」说起:Scale-up 本质、主从 vs 对等架构、互联/语义/保序/池化/散热的全套取舍

超节点科普上篇:以 WAIC 2026 的 1024 卡「一面墙」真机切入,从大模型参数量、MoE、长上下文推理对「卡间互联」的压力讲起,引出 Scale-up 与超节点的本质;厘清超节点与机柜/集群的边界、五大衡量维度(卡数/带宽/延迟/全互联/统一寻址)与信通院定义,梳理架构代际、Chiplet、FP8/FP4、UB Memory、CCU、编程模型、厂商协议大乱斗,以及【主从架构 vs 对等架构 Peer-to-Peer】之争;再拆解关键使能技术:高速互联总线(NVLink/NVSwitch、灵衢 UB)与铜缆 vs 光互联、【Switch-based vs Switchless】、【拓扑 × 集合通信联合优化】、【SUE vs UALink】、【消息语义 vs 内存语义】、【源端 vs 目的端保序】、显存池化与统一编址、多级访存体系、Cache 一致性、液冷与功耗墙。关键指标均标注量级与年代。下篇讲产品对比、应用场景与未来趋势。

超节点(Super Node / SuperPod)深度科普(下):谁在做、怎么对比、往哪走

NVL72 vs CloudMatrix 384 路线之争、国产厂商图谱三条路线、TP/EP/DP/算子/KV 存储/训推画像的全套取舍与未来趋势

超节点科普下篇:用要点列表中立对比 NVIDIA GB200 NVL72(2024-03)与华为 CloudMatrix 384(2025-04,含 SemiAnalysis 测算)的互联规模/带宽/拓扑/生态;盘点国产超节点厂商图谱(华为昇腾 Atlas、阿里磐久/真武 M890、百度昆仑芯/天池、中科曙光曙光8000、浪潮元脑 SD200、沐曦、壁仞、摩尔线程、新华三、清微智能)三条技术路线,并给出 domain/Scale-up/计算 Tray/一层二层网络/P2P 时延等配套维度对比;分析超节点如何改变并行策略,含【TP vs EP】、【DP vs 混合并行】、【算子分解 vs 算子融合】、【KV Cache 中心式 vs 分布式存储】、【训练 vs 推理资源画像】等多组取舍,以及万亿训练、MoE、长上下文 KV Cache 显存压力缓解;最后讨论 Scale-up 物理极限、互联成本、国产生态挑战与光互联(NPO/CPO)、更大 domain、软硬协同的演进方向。关键指标标注量级与年代。上篇讲背景、概念与使能技术。