漫步远方,心荡神往

一文吃透模型量化(上):从浮点表示到 PTQ/QAT 范式

FP32/FP16/INT8/INT4/FP8、仿射映射、对称 vs 非对称、per-tensor vs per-channel、PTQ/QAT/动态 vs 静态/校准 —— 附全局对比表与可运行 PyTorch 代码

模型量化深度科普(上篇):先建立全局对比表,再把『地基层』讲透——浮点与定点表示(FP32/FP16/BF16/INT8/INT4/FP8)、浮点到整数的仿射映射 q=round(x/scale)+zp、对称 vs 非对称量化、per-tensor vs per-channel 粒度,以及量化为何能加速、反量化与伪量化。然后进入通用量化范式:PTQ 后训练量化、QAT 量化感知训练、动态 vs 静态量化、校准方法(MinMax/Percentile/KL/MSE)与异常值问题。每个概念给数值示例、公式推导与可运行代码,含一段『从零实现对称/非对称量化与反量化』的教学代码。下篇讲 LLM 专用方案。

一文吃透模型量化(下):LLM 专用方案 LLM.int8/GPTQ/AWQ/SmoothQuant/NF4

异常值分离、Hessian 逐层量化、激活感知保护、难度平滑迁移、4-bit NormalFloat —— 专治大模型激活异常值与超大权重,附显存估算与可运行代码

模型量化深度科普(下篇):承接上篇的地基与范式,讲透 5 大 LLM 专用量化方案。LLM.int8():异常值分离+混合精度分解;GPTQ:基于 Hessian 二阶信息的逐层 weight-only 量化;AWQ:激活感知、保护显著权重通道;SmoothQuant:数学等价把激活量化难度平滑迁移给权重,使 W8A8 可行;NF4+双重量化:QLoRA 的 4-bit NormalFloat,为何比 INT4 更适配正态分布权重。解释为什么 LLM 激活异常值让 W8A8 比 CNN 更难、4-bit 权重量化对显存的决定性影响,配 transformers+bitsandbytes/auto-gptq/autoawq 可运行代码与显存吞吐估算。

一文吃透分布式通信原语(上):点对点基础与全局图谱

Send/Recv、ISend/IRecv、SendRecv、Barrier —— 一切集合通信的积木,附全局对比表与可运行 PyTorch 代码

分布式通信原语深度科普(上篇):先建立全局图谱(一图速览 + 全局对比表),再把点对点基础层讲透——Send/Recv(阻塞)、ISend/IRecv(非阻塞·计算通信 overlap)、SendRecv(环形不死锁)、Barrier(屏障对齐)。每个原语给出语义图、通信复杂度、原语组合关系,以及在流水线并行(PP)等场景的真实应用,配可运行的 torch.distributed 代码(NCCL/gloo)并附实跑输出。下篇讲集合通信与从零实现 Ring-AllReduce。

一文吃透分布式通信原语(下):集合通信与从零实现 Ring-AllReduce

Broadcast / Scatter / Gather / AllGather / Reduce / AllReduce / ReduceScatter / All2All —— 看懂它们如何由点对点拼成,以及在 DP/TP/FSDP/MoE 中的角色

分布式通信原语深度科普(下篇):逐个讲透集合通信——Broadcast、Scatter/Gather、AllGather、Reduce/AllReduce、ReduceScatter、All2All/AllToAllv。给出语义图、底层算法与通信复杂度(Ring/Tree),讲清为何 Ring-AllReduce 单卡通信量 ≈2S 几乎与卡数无关、AllReduce = ReduceScatter + AllGather 的组合关系,以及在数据并行/张量并行/ZeRO·FSDP/专家并行中的真实应用。每段配可运行的 torch.distributed 代码与实跑输出,并附一段用 Send/Recv 从零实现 Ring-AllReduce 并与官方对拍的教学代码。上篇讲点对点基础与全局对比表。

超节点(Super Node / SuperPod)深度科普(上):为什么出现、是什么、靠什么实现

从 WAIC 2026 的一面「墙」说起:Scale-up 本质、主从 vs 对等架构、互联/语义/保序/池化/散热的全套取舍

超节点科普上篇:以 WAIC 2026 的 1024 卡「一面墙」真机切入,从大模型参数量、MoE、长上下文推理对「卡间互联」的压力讲起,引出 Scale-up 与超节点的本质;厘清超节点与机柜/集群的边界、五大衡量维度(卡数/带宽/延迟/全互联/统一寻址)与信通院定义,梳理架构代际、Chiplet、FP8/FP4、UB Memory、CCU、编程模型、厂商协议大乱斗,以及【主从架构 vs 对等架构 Peer-to-Peer】之争;再拆解关键使能技术:高速互联总线(NVLink/NVSwitch、灵衢 UB)与铜缆 vs 光互联、【Switch-based vs Switchless】、【拓扑 × 集合通信联合优化】、【SUE vs UALink】、【消息语义 vs 内存语义】、【源端 vs 目的端保序】、显存池化与统一编址、多级访存体系、Cache 一致性、液冷与功耗墙。关键指标均标注量级与年代。下篇讲产品对比、应用场景与未来趋势。