漫步远方,心荡神往

聊聊 LLM 推理架构演进中的几个关键技术节点

Static Batching、Continuous Batching 与 Prefill/Decode 分离

本文系统梳理大模型推理架构演进的核心节点:从 Static Batching 到 Continuous Batching(vLLM/SGLang 核心机制),再到 PagedAttention 的 KV Cache 显存管理、Chunked Prefill 以及 Prefill/Decode 分离架构,深入剖析优化吞吐与降低时延的关键工程实践。