漫步远方,心荡神往

DeepSeek 开源周活动

在2025年2月24日至28日的DeepSeek开源周期间,DeepSeek集中发布了五大核心开源项目,全面覆盖AI基础设施中的计算优化、通信效率与存储加速等关键领域,构建起一套面向大规模人工智能的高性能技术底座。

1. DeepSeek 开源周 DeepSeek 在开源了 DeepSeek-R1 与 DeepSeek-V3 模型权重后,DeepSeek-V3 技术报告 《DeepSeek-V3 Technical Report》 中提到的很多核心技术,相继在 “DeepSeek 开源周” (2025.02.24-03.01)中亮相。 天数 项目名称 核心功能 性能指标 Day 1 FlashMLA 高效的 MLA 解码内核,优化变长序列处理 ✅ 3000 GB/s 内存带宽 ✅ 580 TFLOPS (BF16, H800 GPU) Day 2 DeepEP 首个开源 EP 通信库,支持 MoE 模型训练/推理 ✅ 支持 NVLink/RDMA ✅ FP8 原生调度 ✅ 低延迟推理优化 Day 3 DeepGEMM FP8 GEMM 库,支持密集/MoE 矩阵计算 ✅ 1350+ FP8 TFLOPS (Hopper 架构) ✅ 核心代码仅 300 行 Day 4 并行策略优化 • DualPipe: 双向流水线并行

双机2*H20(8*96GiB)部署满血DeepSeek-R1(fp8)验证过程

双机2*H20(8*96GiB)部署满血DeepSeek-R1(fp8)验证过程、vllm 与 sglang 双机测试与性能对比

实战记录双机 2*H20 (16x96GB GPU) 部署 671B 满血 DeepSeek-R1 (FP8) 模型的完整压测过程,深入对比 vLLM 与 SGLang 推理引擎在 TP/PP 张量与管道并行配置下的吞吐率、首字延迟(TTFT)与 Token 生成速度。

单机H20(8*96GiB)部署满血DeepSeek-R1(fp8)验证过程

单机H20(8*96GiB)部署满血DeepSeek-R1(fp8)验证过程、vllm 验证过程、sglang 验证过程

详细评测单节点 H20 8卡环境利用 vLLM 与 SGLang 部署满血 DeepSeek-R1 (FP8) 的技术细节,涵盖 MLA 注意力机制优化、EETQ/Quantization 参数踩坑及多并发下推理性能对比。

单台 H20 机器 DeepSeek R1 (FP8)、DeepSeek-R1-Block-INT8 精度测试与性能测试过程

测试下 DeepSeek R1(FP8)、DeepSeek-R1-Block-INT8 使用单台 H20 机器在 aime、math500、gpqa (使用开源工具 evalscope) 数据集下进行精度测试;给定输入、输出等参数,性能压测;

基于 EvalScope 基准工具对单台 H20 8卡机器上运行的 DeepSeek-R1 (FP8) 与 DeepSeek-R1-Block-INT8 进行精度评测(AIME、MATH500、GPQA)和并发吞吐性能测试实录。

深度剖析 DeepSeek R1 论文

深度剖析 DeepSeek R1 论文,从论文中提炼出关键信息,并分享自己的理解与思考

论文介绍了 R1 整个算法、训练流程和结果,但最核心的应该是数据,包括用于 R1-Zero 的数据是什么,数据量有多大,生成的 60w 数据具体是什么样的,标注的 20w 文科数据是什么,这是决定模型效果比较核心的因素。DeepSeek 的中文效果出圈,猜测很大程度还是标注的 20w 文科数据质量高,这些数据没有公开,要复刻出 DeepSeek 的效果没那么容易。开源社区有很多想要去复现 R1 和 R1-Zero 的研究,比较出名的是 huggingface 的 open-r1、R1-Zero 的开源项目 TinyZero