漫步远方,心荡神往

快手万擎大模型推理系统 kLLM 全栈优化解析与深度点评

从 MLA 混合并行、分级 KV Cache 到 SLO 驱动大 PD 弹性分离

深度剖析快手万擎大模型推理引擎 kLLM 核心优化体系,包含个人实战点评:解读 MLA+DP Attention/MoE EP 混合并行、Ring Attention 分块流水、DSpark 投机解码、三级 KV Cache 增量前缀树与 SLO 驱动的大 PD 弹性分层架构,提炼大模型规模化落地的系统工程方法论。

聊聊 LLM 推理架构演进中的几个关键技术节点

Static Batching、Continuous Batching 与 Prefill/Decode 分离

本文系统梳理大模型推理架构演进的核心节点:从 Static Batching 到 Continuous Batching(vLLM/SGLang 核心机制),再到 PagedAttention 的 KV Cache 显存管理、Chunked Prefill 以及 Prefill/Decode 分离架构,深入剖析优化吞吐与降低时延的关键工程实践。

探索 Transformer 理论与本质

介绍 Transformer 架构和原理,以及大语言模型(LLM)的运作机制。

大语言模型(LLM)的核心是通过自回归方式逐词预测(next token prediction)。文本首先被 tokenizer 拆分为词或子词(如 BPE、BBPE 技术),每个 token 对应一个嵌入向量,并加入位置编码(如 RoPE)以保留顺序信息。模型基于 Transformer 结构,训练时通过注意力机制学习上下文关系,输出每个 token 的下一个词概率分布(softmax 归一化)。推理时采用自回归生成,通过采样策略(如 Top-k)和温度系数控制随机性。ALiBi 技术解决了长文本位置编码的外推问题,使模型能处理超越训练长度的输入。整个过程本质是序列条件概率建模,通过海量数据学习语言的统计规律。

科普开源大模型基础知识

本篇文章主要介绍开源大模型的基础知识,如 LLama 4 和 Qwen 3 的核心亮点和基础架构。

Llama 4 北京时间2025年4月6日凌晨,Meta发布了外界期待许久的Llama4系列开源模型,目前它包括 Llama 4 Scout、Llama 4 Maverick、Llama 4 Behemoth。三种模型对应不同的使用需求,简单来说: Llama 4 Scout 是可以在单张 H100 上跑的多模态 MoE 模型; Llama 4 Maverick 是击败了 GPT-4o 和 Gemini 2.0,比 DeepSeek v3 小但编码和推理能力匹配的“最佳模型”; 还有一个即将发布的、隐藏在后为所有 Llama4 系列提供能力的 2880 亿活跃参数“巨兽”模型 Llama 4 Behemoth; 根据官方发布的介绍,此次 Llama4 有几个重要的技术亮点。 MoE架构

DeepSeek 开源周活动

在2025年2月24日至28日的DeepSeek开源周期间,DeepSeek集中发布了五大核心开源项目,全面覆盖AI基础设施中的计算优化、通信效率与存储加速等关键领域,构建起一套面向大规模人工智能的高性能技术底座。

1. DeepSeek 开源周 DeepSeek 在开源了 DeepSeek-R1 与 DeepSeek-V3 模型权重后,DeepSeek-V3 技术报告 《DeepSeek-V3 Technical Report》 中提到的很多核心技术,相继在 “DeepSeek 开源周” (2025.02.24-03.01)中亮相。 天数 项目名称 核心功能 性能指标 Day 1 FlashMLA 高效的 MLA 解码内核,优化变长序列处理 ✅ 3000 GB/s 内存带宽 ✅ 580 TFLOPS (BF16, H800 GPU) Day 2 DeepEP 首个开源 EP 通信库,支持 MoE 模型训练/推理 ✅ 支持 NVLink/RDMA ✅ FP8 原生调度 ✅ 低延迟推理优化 Day 3 DeepGEMM FP8 GEMM 库,支持密集/MoE 矩阵计算 ✅ 1350+ FP8 TFLOPS (Hopper 架构) ✅ 核心代码仅 300 行 Day 4 并行策略优化 • DualPipe: 双向流水线并行