Toggle navigation
漫步远方,心荡神往
All Posts
LEARNING
ARCHIVE
ABOUT
漫步远方,心荡神往
快手万擎大模型推理系统 kLLM 全栈优化解析与深度点评
从 MLA 混合并行、分级 KV Cache 到 SLO 驱动大 PD 弹性分离
深度剖析快手万擎大模型推理引擎 kLLM 核心优化体系,包含个人实战点评:解读 MLA+DP Attention/MoE EP 混合并行、Ring Attention 分块流水、DSpark 投机解码、三级 KV Cache 增量前缀树与 SLO 驱动的大 PD 弹性分层架构,提炼大模型规模化落地的系统工程方法论。
Posted by
tanjunchen
on Saturday, August 1, 2026
Software Developer