漫步远方,心荡神往

一文吃透分布式通信原语(上):点对点基础与全局图谱

Send/Recv、ISend/IRecv、SendRecv、Barrier —— 一切集合通信的积木,附全局对比表与可运行 PyTorch 代码

分布式通信原语深度科普(上篇):先建立全局图谱(一图速览 + 全局对比表),再把点对点基础层讲透——Send/Recv(阻塞)、ISend/IRecv(非阻塞·计算通信 overlap)、SendRecv(环形不死锁)、Barrier(屏障对齐)。每个原语给出语义图、通信复杂度、原语组合关系,以及在流水线并行(PP)等场景的真实应用,配可运行的 torch.distributed 代码(NCCL/gloo)并附实跑输出。下篇讲集合通信与从零实现 Ring-AllReduce。

一文吃透分布式通信原语(下):集合通信与从零实现 Ring-AllReduce

Broadcast / Scatter / Gather / AllGather / Reduce / AllReduce / ReduceScatter / All2All —— 看懂它们如何由点对点拼成,以及在 DP/TP/FSDP/MoE 中的角色

分布式通信原语深度科普(下篇):逐个讲透集合通信——Broadcast、Scatter/Gather、AllGather、Reduce/AllReduce、ReduceScatter、All2All/AllToAllv。给出语义图、底层算法与通信复杂度(Ring/Tree),讲清为何 Ring-AllReduce 单卡通信量 ≈2S 几乎与卡数无关、AllReduce = ReduceScatter + AllGather 的组合关系,以及在数据并行/张量并行/ZeRO·FSDP/专家并行中的真实应用。每段配可运行的 torch.distributed 代码与实跑输出,并附一段用 Send/Recv 从零实现 Ring-AllReduce 并与官方对拍的教学代码。上篇讲点对点基础与全局对比表。

国产GPU崛起之路:从追赶到突破

10 家主流国产 GPU 厂商技术路线、性能参数、落地现状与 Chiplet 方案全梳理

基于各厂商官网/官方发布会、公开财报与行业研报,图文梳理国产 GPU 产业全景:技术发展历程、稠密 FP16/显存/带宽横向对比、落地场景与营收出货数据、Chiplet 突破制程方案与未来趋势。覆盖华为昇腾、壁仞科技、寒武纪、百度昆仑芯、摩尔线程、沐曦、海光信息、天数智芯、阿里平头哥、燧原科技 10 家厂商;已对关键数据做口径校正(如 BR100 的 1024 实为 INT8 TOPS 而非 FP16),并逐项标注官方/研报来源。

一文看懂 KV Cache(下):工程实践与未来趋势

SGLang(RadixAttention)与 vLLM(PagedAttention)如何管理 KV Cache,以及业界演进方向

KV Cache 科普(下篇):拆解 SGLang(RadixAttention)与 vLLM(PagedAttention)两大主流框架的工程实践,以及连续批处理、Chunked Prefill、缓存感知调度、PD 分离与多级缓存等系统方案;最后展望 MLA、原生稀疏、低比特 KV、集群级 KV 调度等业界未来发展趋势。上篇讲原理与优化思路。

一文看懂 KV Cache(上):从自回归原理到优化思路

为什么大模型推理离不开 KV Cache,以及围绕显存公式的一整套优化方法论

KV Cache 科普(上篇):先讲清自回归推理的冗余计算问题、KV Cache 的原理与显存占用;再从 token 级 / 模型级 / 系统级三个层次,以及显存公式的每个因子(序列长度、头数、比特、头维度、层数、显存管理)梳理优化思路。下篇继续讲两大框架的工程落地与业界未来趋势。