漫步远方,心荡神往

一文看懂 KV Cache(下):工程实践与未来趋势

SGLang(RadixAttention)与 vLLM(PagedAttention)如何管理 KV Cache,以及业界演进方向

KV Cache 科普(下篇):拆解 SGLang(RadixAttention)与 vLLM(PagedAttention)两大主流框架的工程实践,以及连续批处理、Chunked Prefill、缓存感知调度、PD 分离与多级缓存等系统方案;最后展望 MLA、原生稀疏、低比特 KV、集群级 KV 调度等业界未来发展趋势。上篇讲原理与优化思路。

一文看懂 KV Cache(上):从自回归原理到优化思路

为什么大模型推理离不开 KV Cache,以及围绕显存公式的一整套优化方法论

KV Cache 科普(上篇):先讲清自回归推理的冗余计算问题、KV Cache 的原理与显存占用;再从 token 级 / 模型级 / 系统级三个层次,以及显存公式的每个因子(序列长度、头数、比特、头维度、层数、显存管理)梳理优化思路。下篇继续讲两大框架的工程落地与业界未来趋势。

把 TTFT 压到极致:大模型推理加速的全景拆解

从架构调度、KV Cache 复用到通信重叠与算子加速的六大方向体系化拆解

系统拆解大模型推理首字延迟(TTFT)的优化全景:从 PD 分离、Chunked Prefill、Continuous Batching 等架构调度手段,到 Prefix Cache、PagedAttention 缓存复用,再到通信计算 Overlap、并行策略与算子加速,提炼降低 TTFT 的完整工程方法论。