漫步远方,心荡神往

LLM 教程(3)- 《DeepSeek R1 论文精读 - 通过强化学习推动大语言模型推理能力的突破与创新》

LLM 教程(3)- 精读 DeepSeek-R1 的论文,了解现象级 R1 模型是怎么做出来的;

1. 序言 下图展示了 OpenAI(公开文献) 从预训练开始逐步训练出一个 GPT 助手的步骤;pre-training -> SFT -> RM -> RL 是典型的大模型训练过程。 2. DeepSeek R1 论文精读 接下来精读下 DeepSeek-R1 的论文 《DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning》 了解现象级 R1 模型是怎么做出来的。 2.1 摘要 DeepSeek 推出了他们的第一代推理模型,DeepSeek-R1-Zero和DeepSeek-R1; DeepSeek-R1-Zero 这是一个跳过监督微调(SFT)步骤, 直接通过大规模强化学习(RL)训练得到的模型,具备卓越的推理能力。R1-Zero 是在

LLM 教程(2)- 大模型基础知识

LLM 教程(2)- 大模型基础知识,LLM 专有名词、LLM 推理框架、LLM 结果评估

LLM 专有名词 量化(Quantization) 基础知识 LLM 大模型的量化技术主要是通过对模型参数进行压缩和量化,从而降低模型的存储和计算复杂度。具体来说如下: 参数压缩:通过将模型中的浮点数参数转换为低精度的整数参数,量化技术可以实现参数的压缩。这不仅可以减少模型所需的存储空间,还可以降低模型加载的时间。 计算加速:由于低精度整数运算的速度远快于浮点数运算,量化技术还可以通过降低计算复杂度来实现计算加速。这可以在保证模型性能的同时,提高模型的推理速度。 量化技术的三个主要目的:节省显存、加

LLM 教程(1)- DeepSeek-R1 初步入门

DeepSeek-R1 基础知识,开源权重、模型系列、入门介绍等

基础知识 查看 deepseek-ai 开源官网,DeepSeek 有以下系列: DeepSeek-R1 DeepSeek-V3 (DeepSeek-V3-Base) DeepSeek-VL DeepSeek-Coder DeepSeek-Math DeepSeek-LLM 蒸馏模型系列(Qwen、LLaMA等) …… 模型系列 模型名称 类型/架构 参数规模 核心能力 关键技术 DeepSeek-R1 混合专家(MoE) 总参数671B 激活参数37B/token 支持128K上下文 • 对标GPT-4o/Claude 3.5 Sonnet • 数学/编程任务领先 • 完整开源支持 • 动态负载均衡 • 多词元预测(MTP) • FP8混合精度训练(成本$557万) DeepSeek-V3 纯强化学习(RL) 671B基础版 1.5B-70B蒸馏版 • 无需SFT

A800 单机8卡体验 DeepSeek-R1-AWQ 量化满血版之旅

A800 单机8卡体验 DeepSeek-R1-AWQ 量化满血版之旅

探索在单节点 NVIDIA A800 8卡服务器上使用 vLLM 部署 DeepSeek-R1 AWQ (W4A16) 4bit 量化满血版的坑点与性能表现,包含显存占用分析与量化损耗评测。