漫步远方,心荡神往

一文吃透模型量化(上):从浮点表示到 PTQ/QAT 范式

FP32/FP16/INT8/INT4/FP8、仿射映射、对称 vs 非对称、per-tensor vs per-channel、PTQ/QAT/动态 vs 静态/校准 —— 附全局对比表与可运行 PyTorch 代码

模型量化深度科普(上篇):先建立全局对比表,再把『地基层』讲透——浮点与定点表示(FP32/FP16/BF16/INT8/INT4/FP8)、浮点到整数的仿射映射 q=round(x/scale)+zp、对称 vs 非对称量化、per-tensor vs per-channel 粒度,以及量化为何能加速、反量化与伪量化。然后进入通用量化范式:PTQ 后训练量化、QAT 量化感知训练、动态 vs 静态量化、校准方法(MinMax/Percentile/KL/MSE)与异常值问题。每个概念给数值示例、公式推导与可运行代码,含一段『从零实现对称/非对称量化与反量化』的教学代码。下篇讲 LLM 专用方案。

一文吃透模型量化(下):LLM 专用方案 LLM.int8/GPTQ/AWQ/SmoothQuant/NF4

异常值分离、Hessian 逐层量化、激活感知保护、难度平滑迁移、4-bit NormalFloat —— 专治大模型激活异常值与超大权重,附显存估算与可运行代码

模型量化深度科普(下篇):承接上篇的地基与范式,讲透 5 大 LLM 专用量化方案。LLM.int8():异常值分离+混合精度分解;GPTQ:基于 Hessian 二阶信息的逐层 weight-only 量化;AWQ:激活感知、保护显著权重通道;SmoothQuant:数学等价把激活量化难度平滑迁移给权重,使 W8A8 可行;NF4+双重量化:QLoRA 的 4-bit NormalFloat,为何比 INT4 更适配正态分布权重。解释为什么 LLM 激活异常值让 W8A8 比 CNN 更难、4-bit 权重量化对显存的决定性影响,配 transformers+bitsandbytes/auto-gptq/autoawq 可运行代码与显存吞吐估算。

一文吃透分布式通信原语(上):点对点基础与全局图谱

Send/Recv、ISend/IRecv、SendRecv、Barrier —— 一切集合通信的积木,附全局对比表与可运行 PyTorch 代码

分布式通信原语深度科普(上篇):先建立全局图谱(一图速览 + 全局对比表),再把点对点基础层讲透——Send/Recv(阻塞)、ISend/IRecv(非阻塞·计算通信 overlap)、SendRecv(环形不死锁)、Barrier(屏障对齐)。每个原语给出语义图、通信复杂度、原语组合关系,以及在流水线并行(PP)等场景的真实应用,配可运行的 torch.distributed 代码(NCCL/gloo)并附实跑输出。下篇讲集合通信与从零实现 Ring-AllReduce。

一文吃透分布式通信原语(下):集合通信与从零实现 Ring-AllReduce

Broadcast / Scatter / Gather / AllGather / Reduce / AllReduce / ReduceScatter / All2All —— 看懂它们如何由点对点拼成,以及在 DP/TP/FSDP/MoE 中的角色

分布式通信原语深度科普(下篇):逐个讲透集合通信——Broadcast、Scatter/Gather、AllGather、Reduce/AllReduce、ReduceScatter、All2All/AllToAllv。给出语义图、底层算法与通信复杂度(Ring/Tree),讲清为何 Ring-AllReduce 单卡通信量 ≈2S 几乎与卡数无关、AllReduce = ReduceScatter + AllGather 的组合关系,以及在数据并行/张量并行/ZeRO·FSDP/专家并行中的真实应用。每段配可运行的 torch.distributed 代码与实跑输出,并附一段用 Send/Recv 从零实现 Ring-AllReduce 并与官方对拍的教学代码。上篇讲点对点基础与全局对比表。

国产GPU崛起之路:从追赶到突破

10 家主流国产 GPU 厂商技术路线、性能参数、落地现状与 Chiplet 方案全梳理

基于各厂商官网/官方发布会、公开财报与行业研报,图文梳理国产 GPU 产业全景:技术发展历程、稠密 FP16/显存/带宽横向对比、落地场景与营收出货数据、Chiplet 突破制程方案与未来趋势。覆盖华为昇腾、壁仞科技、寒武纪、百度昆仑芯、摩尔线程、沐曦、海光信息、天数智芯、阿里平头哥、燧原科技 10 家厂商;已对关键数据做口径校正(如 BR100 的 1024 实为 INT8 TOPS 而非 FP16),并逐项标注官方/研报来源。