漫步远方,心荡神往

2026 新年快乐(Happy New Year)

新年的钟声已经敲响,我们迎来了充满活力与奔赴感的 2026 马年!🎉 感谢过去一年里的陪伴与支持,新的一年,愿我们策马前行,奔赴更远的目标,收获更多值得铭记的美好时刻。🌟 祝愿大家在 2026 马年: 🐎 身体健康,精力充沛,步伐坚定; 🐎 事业顺利,马到成功,一路加速; 🐎 家庭幸福,温暖相伴,岁月安然; 🐎 心想事成,所行皆坦途,所愿皆可期! 愿所有的努力都不被辜负,所有的梦想都能快马加鞭、如期抵达。 让我们怀揣热爱,迎风奔跑,共同书写 马年 更加精彩的篇章! 马年大吉,新春快乐,万事如意! 🎊🎁

聊聊 LLM 推理加速常见手段

从 KV Cache 优化、FlashAttention 算子到量化与投机采样

全面盘点大模型推理优化加速核心手段:涉及 KV Cache 优化、FlashAttention/FlashDecoding 算子加速、Quantization 量化(AWQ/FP8)、Speculative Decoding 投机采样以及 Continuous Batching 调度算法。

聊聊 LLM 推理架构演进中的几个关键技术节点

Static Batching、Continuous Batching 与 Prefill/Decode 分离

本文系统梳理大模型推理架构演进的核心节点:从 Static Batching 到 Continuous Batching(vLLM/SGLang 核心机制),再到 PagedAttention 的 KV Cache 显存管理、Chunked Prefill 以及 Prefill/Decode 分离架构,深入剖析优化吞吐与降低时延的关键工程实践。

探索 Transformer 理论与本质

介绍 Transformer 架构和原理,以及大语言模型(LLM)的运作机制。

大语言模型(LLM)的核心是通过自回归方式逐词预测(next token prediction)。文本首先被 tokenizer 拆分为词或子词(如 BPE、BBPE 技术),每个 token 对应一个嵌入向量,并加入位置编码(如 RoPE)以保留顺序信息。模型基于 Transformer 结构,训练时通过注意力机制学习上下文关系,输出每个 token 的下一个词概率分布(softmax 归一化)。推理时采用自回归生成,通过采样策略(如 Top-k)和温度系数控制随机性。ALiBi 技术解决了长文本位置编码的外推问题,使模型能处理超越训练长度的输入。整个过程本质是序列条件概率建模,通过海量数据学习语言的统计规律。

科普开源大模型基础知识

本篇文章主要介绍开源大模型的基础知识,如 LLama 4 和 Qwen 3 的核心亮点和基础架构。

Llama 4 北京时间2025年4月6日凌晨,Meta发布了外界期待许久的Llama4系列开源模型,目前它包括 Llama 4 Scout、Llama 4 Maverick、Llama 4 Behemoth。三种模型对应不同的使用需求,简单来说: Llama 4 Scout 是可以在单张 H100 上跑的多模态 MoE 模型; Llama 4 Maverick 是击败了 GPT-4o 和 Gemini 2.0,比 DeepSeek v3 小但编码和推理能力匹配的“最佳模型”; 还有一个即将发布的、隐藏在后为所有 Llama4 系列提供能力的 2880 亿活跃参数“巨兽”模型 Llama 4 Behemoth; 根据官方发布的介绍,此次 Llama4 有几个重要的技术亮点。 MoE架构