漫步远方,心荡神往

深度剖析 NVIDIA 数据中心 GPU:从整机拆解到架构演进(Pascal → Rubin)

一篇讲清 GPU 服务器由什么组成,以及每一代旗舰卡的核心参数

系统梳理 NVIDIA 数据中心 GPU 的发展史:先从整机视角拆解 GPU 服务器的各个组件(GPU Die、HBM 显存、NVLink 互联、NVSwitch 交换、网络、CPU、内存、散热、供电)及其核心能力,再逐代盘点 Pascal / Volta / Turing / Ampere / Ada Lovelace / Hopper / Blackwell / Rubin 的关键技术参数,并附中国特供版说明。数据来自官方 Datasheet 与公开路线图。

一文读懂 PFLOPS 算力:从 FP32 到 FP4,NVIDIA 与华为昇腾算力对比

为什么同一张卡在不同精度下算力差好几倍?

面向大模型时代的算力科普:讲清 FLOPS / TFLOPS / PFLOPS 的单位换算,解释 FP32、FP16/BF16、FP8、FP4 等数值精度的差异与取舍,并以 NVIDIA H100/B200 和华为昇腾 910B/910C 为例,横向对比不同精度下的峰值算力,最后说明峰值算力与真实性能之间的鸿沟。

快手万擎大模型推理系统 kLLM 全栈优化解析与深度点评

从 MLA 混合并行、分级 KV Cache 到 SLO 驱动大 PD 弹性分离

深度剖析快手万擎大模型推理引擎 kLLM 核心优化体系,包含个人实战点评:解读 MLA+DP Attention/MoE EP 混合并行、Ring Attention 分块流水、DSpark 投机解码、三级 KV Cache 增量前缀树与 SLO 驱动的大 PD 弹性分层架构,提炼大模型规模化落地的系统工程方法论。

把 TTFT 压到极致:大模型推理加速的全景拆解

从架构调度、KV Cache 复用到通信重叠与算子加速的六大方向体系化拆解

系统拆解大模型推理首字延迟(TTFT)的优化全景:从 PD 分离、Chunked Prefill、Continuous Batching 等架构调度手段,到 Prefix Cache、PagedAttention 缓存复用,再到通信计算 Overlap、并行策略与算子加速,提炼降低 TTFT 的完整工程方法论。

AI-Infra:构建支撑大规模训练与推理基础设施平台

解析 GPU 异构算力调度、训推引擎与工程落地实践

深入解析 AI-Infra 基础设施平台架构:从 GPU 异构算力管理、高性能网络存储,到训练框架与 vLLM/SGLang 推理引擎集成,系统探讨支撑大模型训推工程落地与持续演进的系统工程实践。