国内外 GPU 芯片全景:从 CPU/GPU/GPGPU 概念到国产替代

一文看懂 GPU 是什么、国外国内进展到哪了、市场份额如何分布、未来还有哪些期待与挑战

Posted by tanjunchen on Tuesday, September 29, 2026  ·  阅读  ·   ·  预计阅读约 16 分钟

0. 写在前面

「算力」已从技术名词变成产业与地缘焦点,而算力的核心载体就是 GPU。本文用一条主线讲清四件事:GPU 是什么 → 国外做到哪了 → 国内做到哪了 → 差距与未来。

数据口径说明:本文份额/财务数据分别来自 NVIDIA SEC 官方财报、Jon Peddie Research(独显出货)、Silicon Analysts/IDC(AI 加速器)、Bernstein(中国收入口径)、IDC(中国出货)、中商产业研究院及各厂商招股书。未量产产品(昇腾 960/970、C700、BR20X 等)为官方路线图/宣称值。芯片与市场数据更新极快,以官方最新发布为准。


1. CPU、GPU 与 GPGPU 概念

三个词不是并列,而是演进关系。

CPU vs GPU vs GPGPU 概念对比

  • CPU(中央处理器):核少、单核强,擅长复杂逻辑与串行任务,设计哲学是低延迟。
  • GPU(图形处理器):核极多、单核弱,擅长把同一运算「铺开」到海量数据上并行,设计哲学是高吞吐。
  • GPGPU(通用 GPU 计算):让 GPU 去干通用计算(矩阵、张量、科学计算)的技术路线,是 GPU 从「画画」走向「算数」的关键一跃。

一个比喻:CPU 像几位博士(什么难题都能解,但人少);GPU 像几千个小学生(只会加减乘除,但人多,简单题瞬间算完);GPGPU 则是「教这几千个小学生去算科学题」的方法论与工具链。

为什么 AI 离不开 GPU:深度学习本质是大规模、彼此独立的矩阵乘加,天然适合并行。推动 GPGPU 主流化的是两件事——硬件上 NVIDIA 加入 Tensor Core(支持 FP16/FP8/FP4),软件上 CUDA 生态形成极高迁移壁垒(「CUDA 护城河」)。

与 NPU/ASIC 的区分:并非所有 AI 加速卡都是 GPU。GPGPU(NVIDIA、AMD,及脱胎于图形 GPU 路线的沐曦、壁仞、天数、摩尔线程、海光 DCU)通用性强;NPU/专用 ASIC(华为昇腾、寒武纪、燧原、谷歌 TPU、AWS Trainium)牺牲通用性换能效比。

灰色地带:CSP(云厂商)自研的 XPU/PPU 架构(百度昆仑芯 XPU、阿里平头哥「真武」PPU)不好一刀切——它们不是从图形 GPU 演化来的经典 GPGPU(没有图形渲染),而是自研的通用性 AI 加速架构:按「通用/可编程」看偏 GPGPU(阿里官方称真武 810E 走 GPGPU 路线,昆仑芯 XPU 支持标量/矢量/张量与 CUDA 兼容),按「自研专用 + 绑定自家云」看又偏 CSP-ASIC。本文归入「全栈自研」一类,但读者知道它介于两者之间即可。

本文讨论国产格局时把上述几类一并纳入——它们在市场上竞争同一批 AI 算力订单。


2. 国外 GPU 芯片进展(含市场占比)

国外 GPU / AI 加速器市场占比

2.1 NVIDIA:绝对主导

壁垒来自「芯片 + 软件 + 网络 + 生态」的系统级能力,而非单卡性能。

  • AI 加速器:收入口径约占 80%(Silicon Analysts/IDC)。
  • 独立 GPU(AIB):90%(Jon Peddie Research,Q1 2026;已连续 5 个季度维持 ≥90%)。
  • 官方财报(最新):Q2 FY2027(2026-08-26 发布,季度截至 2026-07-26)总营收 $96.2B(同比 +106%),数据中心收入 $89.0B(同比 +117%,占总营收约 92%),GAAP 毛利率 75.0%,Q3 FY27 指引 $108B;上一财年(FY2026)数据中心全年收入 $193.7B(占公司总营收 90%)。
  • 产品:Hopper(H100/H200)→ Blackwell / Blackwell Ultra(B200/GB200 NVL72)→ 已公布 Rubin(3nm、HBM4),近乎「一年一迭代」。
  • 护城河:CUDA 600 万+ 开发者(NVIDIA 2025 年报口径)+ NVLink/NVSwitch + InfiniBand 网络。

2.2 AMD:稳居第二,性价比突围

  • 份额:AI 加速器约 5%~7%(Instinct 2025 收入约 $7~8B);独显(AIB)约 8%(JPR Q1 2026)。
  • 官方财报(最新):Q2 2026(2026-08-04 发布)总营收 $11.5B(同比 +50%),数据中心收入 $6.7B(同比 +107%,占公司营收 58%),Instinct 销售额同比翻倍,MI350 系列持续放量。
  • 产品:MI300X → MI325X → MI350X → 新一代 MI450 + Helios 机架方案(已获 Meta、Microsoft、OpenAI 部署合作)。MI350X FP8 约 4600 TFLOPS、HBM3E 288GB(对比 B200 的 192GB)显存领先;但软件成熟度使实际 MFU(~45%)低于 NVIDIA(50%~55%)。
  • 软件:以开源 ROCm(含 ROCm.ai)对抗 CUDA,绑定微软 Azure、Meta、OpenAI。

2.3 Intel:掉队后重新起步

  • 份额:AI GPU 约 1%;独显维持 1%(JPR Q1 2026)。
  • 产品:Gaudi3(性价比 + oneAPI);下一代「Crescent Island」(Xe3P、160GB LPDDR5X、风冷推理)2026 下半年送样,放量最早 2027。
  • 变数:2025-09 NVIDIA 反向投资 Intel 50 亿美元;Intel 更多在 CPU 推理与代工方向找机会。

2.4 云厂商自研 ASIC:不容忽视的「第四极」

超大规模云厂商自研芯片正从另一维度分流通用 GPU:Google TPU(v6)、AWS Trainium2、Microsoft Maia、Meta MTIA。

Broadcom AI ASIC 收入 FY2025 已超 $20B;TrendForce 称 2026 年定制 ASIC 出货增速约 44.6%,明显高于通用 GPU 的约 16.1%。AI 加速器 TAM 从 2023 年约 $55B → 2025 约 $160B → 2026 $200B+,其中推理有望占约 2/3。Silicon Analysts 认为,对 NVIDIA 更大的结构性威胁来自云厂商自研 ASIC,而非 AMD。

2.5 国外格局小结

厂商 / 类别AI 加速器份额(收入,2026)独显份额(JPR Q1'26)关键标签
NVIDIA~80%90%CUDA + 系统级壁垒
AMD~5%~7%8%大显存 + 性价比 + ROCm
Intel~1%1%性价比 + oneAPI + 代工
云厂商 ASIC快速增长—自用、定制、增速最快

3. 国内 GPU 芯片进展(含市场占比)

3.1 大势:从「信创替补」到「市场主力」

NVIDIA 高端卡在华供应几近「归零」,特供版(H20 等)几经反复,被动腾出的真空被国产快速填补。中商产业研究院预测,中国 GPU 市场规模将从 2026 年约 2050 亿元 攀升至 2030 年约 5420 亿元。

中国 AI 加速卡市场占比 IDC 2025

出货口径(IDC《2025 年度中国云端 AI 加速器市场报告》,2026-04 发布,全年约 400 万张):NVIDIA 约 220 万张(55%)仍居首,但较此前近乎 95% 的高份额显著回落;国产合计约 165 万张,占 41%(较 2024 年约 30% 明显提升)。其中华为昇腾约 81.2 万张(占国产 49.2%、占整体市场约 20%,居国产第一)、阿里平头哥约 26.5 万张、昆仑芯/寒武纪各约 11.6 万张(并列第三)、海光约占国产 5%、沐曦约 6.6 万张、天数约 5 万张。

两个口径同向:Bernstein 收入口径(2024)——NVIDIA ~66%、华为昇腾 ~23%、AMD ~5%、其余 ~1%。2026 最新预测更为激进:TrendForce(2026-08)称 2026 年中国高端 AI 芯片国产份额有望接近 90%、出货量同比 +83%;Bernstein 预测 NVIDIA 在华份额或从 2025 年 ~40% 降至 2026 年 ~8%、华为或超 50%。结论一致:华为昇腾是国产绝对龙头,国产替代已从政策驱动转向市场驱动。

3.2 国产 GPU 厂商图谱:三条技术路线

国产 GPU 厂商三条技术路线图谱

  • 路线一 · 全功能 GPU(图形 + 计算):摩尔线程、景嘉微、象帝先、芯动科技。
  • 路线二 · 通用 GPU/GPGPU(主攻 AI 训推、尽量兼容 CUDA):寒武纪、海光、沐曦、壁仞、天数智芯。
  • 路线三 · 全栈自研/专用(DSA/NPU 或自研通用架构、绑定自家云):华为昇腾(NPU)、燧原(DSA)、昆仑芯(XPU)、平头哥(PPU)。其中昆仑芯 XPU、平头哥 PPU 属「自研通用 AI 架构」,介于 GPGPU 与专用 ASIC 之间。

3.3 发展历程与关键动态

华为昇腾(NPU/达芬奇,国产龙头)——2019 年起推出 310/910 系列(910B/910C);2026 Q1 已上市的昇腾 950PR 采用自研 HBM(HiBL 1.0,128GB、1.6TB/s),FP8 1 PFLOPS、FP4 2 PFLOPS、互联 2TB/s,据华为宣称其推理算力约为 H20 的 2.87 倍(搭配 Atlas 350);950DT(HiZQ 2.0,144GB、4TB/s,面向 Decode/训练)已提前至 2026 年 8 月上华为云。2026-09 全联接大会上,华为宣布 960 系列研发提前(960DT 2027Q1、960PR 2027Q3)并新增 970(2028)、980(2029) 路线图,配套「灵衢」超节点,详见下图。

华为昇腾芯片路线图

寒武纪——思元 690(2026 初量产,双 die,FP16 >700 TFLOPS,196GB HBM3);2025 营收 64.97 亿元(+453%),首次年度盈利。

海光信息——CPU + DCU 双轮驱动,深度兼容 CUDA、算子覆盖 >99%;深算四号 2026H2、支持 FP4。

摩尔线程——创始人张建中为前 NVIDIA 中国区总经理;四年四代架构(第四代「平湖」支持 FP8),2025 底推「花港」(能效 +10x),KUAE 万卡集群;2025 营收 15.06 亿元(+243%),科创板上市。

沐曦股份——创始人来自 AMD;曦云 C500 对标 A100,C600 介于 A100~H100、全国产供应链闭环、2026H1 量产,C700 对标 H100(2026H2 流片);2025 营收 16.44 亿元,2026H1 扭亏为盈,科创板(688802)上市。

壁仞科技——2026-01-02 港交所(06082.HK)「港股 GPU 第一股」;BR100/BR166(Chiplet)→ BR20X(2026 商业化,FP8/FP4),BLink2.0 超节点最高 1024 卡;2025 营收 10.35 亿元。

天数智芯——国内首家训推通用 GPU 都量产;天垓 300(SIMT,2026-07 WAIC),2026H1 推理系列收入同比 +651.8%;2025 营收约 10.34 亿元。

燧原科技——DSA 路线,邃思 400/L600 宣称对标并超越 H20、原生 FP8;2025 营收 9.90 亿元,2026-06 过会科创板。

昆仑芯(百度)/ 平头哥(阿里)——CSP 自研通用架构、绑定自家云,出货已进第一梯队。昆仑芯自研 XPU 架构,P800(7nm、XPU-P,FP16 约 345 TFLOPS、96GB HBM、兼容 CUDA 以降低迁移成本),在中国移动 AI 服务器采购中多标段中标(据报道中标份额达 70%/70%/100%),2025 年外部客户收入已过半,2026-06 推出「天池 256 卡超节点」(官方称有效训练率约 97%,已支撑文心 5.1 训练)。平头哥自研 「真武」PPU(真武 810E 走 GPGPU 路线、96GB HBM2e、700GB/s 片间互联),已规模用于千问大模型训推,据《晚点 LatePost》报道累计出货已达数十万片、超过寒武纪,2025 年 3 月起启动对外转售,并拿下小鹏、比亚迪超万片订单。

昆仑芯、平头哥与华为昇腾并称国产 AI 芯片「三强」(2026 年 IDC/媒体口径)。

摩尔线程、沐曦、壁仞、天数并称「国产 GPU 四小龙」,均已完成或推进上市。

3.4 硬核对比:国产主要产品性能参数一览

厂商代表产品类型对标关键规格商业化2025 营收
华为昇腾 950PRNPUH20+128GB 内存,1.6TB/s,推理算力 ~2.87× H20,自研 HBM2026Q1 已上市—
寒武纪思元 690GPGPU—FP16 >700 TFLOPS,196GB HBM3,双 die2026 初64.97 亿
海光深算四号DCU主流 GPGPU兼容 CUDA,算子 >99%,支持 FP42026H2上市公司
摩尔线程平湖/花港全功能 GPU—花港能效 +10x,KUAE 万卡2026 陆续15.06 亿
沐曦曦云 C600/C700全栈 GPUA100~H100全国产闭环,多精度含 FP8C600 2026H116.44 亿
壁仞BR20XGPGPU—FP8/FP4,超节点 1024 卡202610.35 亿
天数智芯天垓 300SIMT GPU—训推通用2026 已发布10.34 亿
燧原邃思 400/L600DSAH20原生 FP8,训推一体已推广9.90 亿

对标口径多为厂商宣称/特定场景实测;高端产品受先进制程与 HBM 供应约束,「纸面参数」与「规模稳定可用」仍有差距。

3.5 落地应用现状

  • 推理先行:推理对单卡算力的要求相对训练更低、任务相对固定且易于针对性优化。IDC 数据显示,未来五年国内推理算力年复合增速约 190%,明显高于训练的约 50%。
  • Day-0 生态适配:DeepSeek-V4 发布后至少 8 家国产芯片厂商公布适配,V4 Flash 发布时数日内超百家企业实现「Day-0 接入」;美团 LongCat-2.0 声称训练到推理全程使用国产算力(训练峰值超 5 万张国产卡),形成「国产模型 + 国产芯片」闭环。
  • 集群工程:甘肃庆阳国产万卡推理集群(燧原 S60 推理卡,已获大规模智算集群五星认证)已点亮对外服务;LightSphere X 光互连超节点(上海仪电/曦智/壁仞/中兴)打通跨机柜互联;华为 Atlas 超节点进入规模商用。
  • 订单验证:摩尔线程获 6.6 亿元夸娥订单、沐曦在手订单 14.30 亿元(截至 2025-09-05),从「送测」走向「批量采购」。

4. 国内外横向对比(含市场占比)

4.1 市场占比对比

维度国外(全球)国内(中国市场)
龙头份额NVIDIA AI 加速器 ~80%(收入)NVIDIA ~55%(出货,2025);Bernstein 预测 2026 或降至 ~8%
第二名AMD ~5%~7%华为昇腾 20%(出货)/ 23%(收入,2024),2026 或超 50%
长尾格局Intel ~1% + 云厂商 ASIC 快速增长平头哥/昆仑芯/寒武纪/海光/四小龙合计约 21%
整体趋势NVIDIA 数据中心季度收入 $89B(Q2 FY27)国产份额 41%(2025),高端市场 2026 或近 90%
市场规模2026 数据中心加速器 >$200B2026 约 2050 亿元 → 2030 约 5420 亿元

4.2 能力维度对比

维度国外(以 NVIDIA 为标杆)国内(整体)
单卡算力领先,Blackwell/Rubin 一年一迭代头部对标 A100-H100,与最新旗舰差 1-2 代
先进制程可用 TSMC 3nm/4nm受管制,先进制程与 HBM 供应受限
软件生态CUDA,600 万+ 开发者,壁垒极高MUSA/NeuWare/ROCm-like,仍在建设中
系统级互联NVLink/NVSwitch + InfiniBand 成熟华为「灵衢」超节点是亮点,其余仍在补课
供应链自主依赖 TSMC / HBM 大厂沐曦 C600 等已实现闭环,但 HBM 国产化率仍不足 2%

一句话总结差距:国内在「单点参数」上正快速逼近,在「系统工程」(互联、集群、软件生态、供应链)上仍有明显代差。「中国英伟达」比拼的不是一颗芯片,而是芯片 + 软件 + 工具 + 服务器 + 网络 + 开发者生态的全栈系统能力。


5. 未来挑战与展望

国产 GPU 三大长期挑战

5.1 三大长期挑战

  • 先进制程依赖:高端 AI 芯片需 5nm/3nm,国内先进制程产能与 EUV 设备受限——最硬的天花板。华为用「架构创新 + 超节点堆规模」对冲单卡制程劣势。
  • HBM 供应瓶颈:HBM 决定「装得下 + 喂得饱」,三星/SK 海力士/美光垄断约 95%,国产化率极低(不足 2%,部分口径称接近 0),且三大厂 2026 年产能已售罄。昇腾 950PR 采用自研 HBM(HiBL 1.0)是重要信号。
  • 软件生态成熟度:CUDA 的 600 万+ 开发者(NVIDIA 2025 年报口径)与近二十年积累,比硬件更难跨越。国产需在算子覆盖、框架适配、迁移工具与开发者习惯上长期投入。

5.2 结构性机遇

推理需求五年 190% 复合增速且对制程要求低(最现实主战场);国产模型 Day-0 适配形成「模型—芯片—框架」正循环;「超节点/集群竞争」新范式给系统工程弯道超车空间;四小龙密集上市提供长期资本弹药(但当前 PS 估值偏高,透支了未来份额预期)。

5.3 展望

  • 短期(1~2 年):推理场景国产替代加速,华为昇腾领跑,四小龙靠细分场景 + 性价比放量。
  • 中期(3~5 年):自研 HBM、Chiplet、超节点与软件生态成熟后,国产有望在训练场景规模化落地,份额进一步集中。
  • 长期:竞争终局是全栈系统能力与开发者生态——谁能同时打通芯片、软件、集群、网络与生态,谁才有机会成为真正的「中国英伟达」。

收尾一句:国外拼「继续领先」,国内拼「补齐系统 + 生态」。 单卡参数差距在缩小,但真正的胜负手,在软件生态与系统工程这两条更难走的路上。


附录:参考与数据来源

厂商官方(财报 / 产品)

市场研究机构

  • Jon Peddie Research(独显/AIB 出货份额,Q1 2026 NVIDIA 90%):https://www.jonpeddie.com/news/
  • Silicon Analysts(AI 加速器市场份额与 TAM):https://siliconanalysts.com/analysis/amd-vs-nvidia-ai-gpu-market-share-2026
  • IDC《2025 年度中国云端 AI 加速器市场报告》(2026-04;国产 41%、NVIDIA 55%)
  • Bernstein Research(中国 AI 半导体收入口径与 2026 份额预测)
  • TrendForce(2026-08:中国高端 AI 芯片国产份额近 90%、定制 ASIC 增速)
  • 中商产业研究院(中国 GPU 市场规模 2026→2030 预测)

公开报道(转引上述机构数据)

本文为产业综述,数据随政策与产品迭代变化较快,具体请以各厂商与权威机构最新发布为准。文中转引的机构报告(IDC/Bernstein/TrendForce 等)以公开报道口径为准。