漫步远方,心荡神往

一文看懂 KV Cache(下):工程实践与未来趋势

SGLang(RadixAttention)与 vLLM(PagedAttention)如何管理 KV Cache,以及业界演进方向

KV Cache 科普(下篇):拆解 SGLang(RadixAttention)与 vLLM(PagedAttention)两大主流框架的工程实践,以及连续批处理、Chunked Prefill、缓存感知调度、PD 分离与多级缓存等系统方案;最后展望 MLA、原生稀疏、低比特 KV、集群级 KV 调度等业界未来发展趋势。上篇讲原理与优化思路。

一文看懂 KV Cache(上):从自回归原理到优化思路

为什么大模型推理离不开 KV Cache,以及围绕显存公式的一整套优化方法论

KV Cache 科普(上篇):先讲清自回归推理的冗余计算问题、KV Cache 的原理与显存占用;再从 token 级 / 模型级 / 系统级三个层次,以及显存公式的每个因子(序列长度、头数、比特、头维度、层数、显存管理)梳理优化思路。下篇继续讲两大框架的工程落地与业界未来趋势。

国内外 GPU 芯片全景:从 CPU/GPU/GPGPU 概念到国产替代

一文看懂 GPU 是什么、国外国内进展到哪了、市场份额如何分布、未来还有哪些期待与挑战

图文并茂梳理 GPU 产业全景:先讲清 CPU / GPU / GPGPU 概念,再盘点国外 NVIDIA / AMD / Intel 与云厂商自研 ASIC 的最新进展与市场占比(NVIDIA 官方财报 + Jon Peddie Research + Silicon Analysts),接着梳理国内 GPU 厂商图谱(华为昇腾、寒武纪、海光、摩尔线程、沐曦、壁仞、天数智芯、燧原、昆仑芯、平头哥)技术路线、性能参数与落地现状(IDC 2025 出货数据),随后做国内外横向对比,最后讨论制程、HBM、软件生态三大挑战与未来展望。

深度剖析 NVIDIA 数据中心 GPU:从整机拆解到架构演进(Pascal → Rubin)

一篇讲清 GPU 服务器由什么组成,以及每一代旗舰卡的核心参数

系统梳理 NVIDIA 数据中心 GPU 的发展史:先从整机视角拆解 GPU 服务器的各个组件(GPU Die、HBM 显存、NVLink 互联、NVSwitch 交换、网络、CPU、内存、散热、供电)及其核心能力,再逐代盘点 Pascal / Volta / Turing / Ampere / Ada Lovelace / Hopper / Blackwell / Rubin 的关键技术参数,并附中国特供版说明。数据来自官方 Datasheet 与公开路线图。

一文读懂 PFLOPS 算力:从 FP32 到 FP4,NVIDIA 与华为昇腾算力对比

为什么同一张卡在不同精度下算力差好几倍?

面向大模型时代的算力科普:讲清 FLOPS / TFLOPS / PFLOPS 的单位换算,解释 FP32、FP16/BF16、FP8、FP4 等数值精度的差异与取舍,并以 NVIDIA H100/B200 和华为昇腾 910B/910C 为例,横向对比不同精度下的峰值算力,最后说明峰值算力与真实性能之间的鸿沟。