Toggle navigation
漫步远方,心荡神往
All Posts
LEARNING
ARCHIVE
ABOUT
漫步远方,心荡神往
一文吃透模型量化(上):从浮点表示到 PTQ/QAT 范式
FP32/FP16/INT8/INT4/FP8、仿射映射、对称 vs 非对称、per-tensor vs per-channel、PTQ/QAT/动态 vs 静态/校准 —— 附全局对比表与可运行 PyTorch 代码
模型量化深度科普(上篇):先建立全局对比表,再把『地基层』讲透——浮点与定点表示(FP32/FP16/BF16/INT8/INT4/FP8)、浮点到整数的仿射映射 q=round(x/scale)+zp、对称 vs 非对称量化、per-tensor vs per-channel 粒度,以及量化为何能加速、反量化与伪量化。然后进入通用量化范式:PTQ 后训练量化、QAT 量化感知训练、动态 vs 静态量化、校准方法(MinMax/Percentile/KL/MSE)与异常值问题。每个概念给数值示例、公式推导与可运行代码,含一段『从零实现对称/非对称量化与反量化』的教学代码。下篇讲 LLM 专用方案。
Posted by
tanjunchen
on Monday, October 5, 2026
一文吃透模型量化(下):LLM 专用方案 LLM.int8/GPTQ/AWQ/SmoothQuant/NF4
异常值分离、Hessian 逐层量化、激活感知保护、难度平滑迁移、4-bit NormalFloat —— 专治大模型激活异常值与超大权重,附显存估算与可运行代码
模型量化深度科普(下篇):承接上篇的地基与范式,讲透 5 大 LLM 专用量化方案。LLM.int8():异常值分离+混合精度分解;GPTQ:基于 Hessian 二阶信息的逐层 weight-only 量化;AWQ:激活感知、保护显著权重通道;SmoothQuant:数学等价把激活量化难度平滑迁移给权重,使 W8A8 可行;NF4+双重量化:QLoRA 的 4-bit NormalFloat,为何比 INT4 更适配正态分布权重。解释为什么 LLM 激活异常值让 W8A8 比 CNN 更难、4-bit 权重量化对显存的决定性影响,配 transformers+bitsandbytes/auto-gptq/autoawq 可运行代码与显存吞吐估算。
Posted by
tanjunchen
on Monday, October 5, 2026
Software Developer