Atelier Optik

日记随笔

2020-2026 典型 NVIDIA GPU 架构对比

从 Ampere、Ada Lovelace、Hopper 到 Blackwell,N 卡这几年真正变化的不只是“更快”,而是显存、互联、Tensor Core 精度和软件生态一起变了。

先看一张总表

下表选取的是 2020-2026 年间有代表性的 NVIDIA GPU,而不是穷举所有 SKU。表中把 CUDA Core、Tensor Core、显存、带宽和典型计算峰值拆开列出;不同产品线公开规格口径并不完全一致,因此更适合做架构和代际趋势比较。

GPU 架构 CUDA Core Tensor Core 显存 带宽 FP32 峰值 Tensor / AI 峰值
2020 - A100 80GB SXM Ampere 6,912 432(第三代) 80GB HBM2e 约 2.0 TB/s 19.5 TFLOPS FP16 Tensor 312 TFLOPS;稀疏约 624 TFLOPS
2020 - GeForce RTX 3090 Ampere 10,496 328(第三代) 24GB GDDR6X 936 GB/s 约 35.6 TFLOPS 约 285 Tensor TFLOPS(稀疏口径)
2022 - H100 SXM Hopper 16,896 528(第四代) 80GB HBM3 3.35 TB/s 67 TFLOPS FP8 Tensor 3,958 TFLOPS(含稀疏);FP16/BF16 1,979 TFLOPS(含稀疏)
2022 - GeForce RTX 4090 Ada Lovelace 16,384 512(第四代) 24GB GDDR6X 约 1,008 GB/s 约 82.6 TFLOPS 约 1,321 Tensor TFLOPS(稀疏口径)
2022 - RTX 6000 Ada Ada Lovelace 18,176 568(第四代) 48GB GDDR6 ECC 960 GB/s 约 91.1 TFLOPS 约 1,457 Tensor TFLOPS(稀疏口径)
2023 - L40S Ada Lovelace 18,176 568(第四代) 48GB GDDR6 ECC 864 GB/s 约 91.6 TFLOPS FP8 Tensor 1,466 TFLOPS(含稀疏)
2024 - H200 SXM Hopper 16,896 528(第四代) 141GB HBM3e 4.8 TB/s 67 TFLOPS FP8 Tensor 3,958 TFLOPS(含稀疏);FP16/BF16 1,979 TFLOPS(含稀疏)
2025 - B200 Blackwell 官方未按消费卡口径列出 第五代 Tensor Core 192GB HBM3e 8.0 TB/s 75 TFLOPS FP8 Tensor 9 PFLOPS(含稀疏);FP4 Tensor 18 PFLOPS(含稀疏)
2025 - RTX PRO 6000 Blackwell Blackwell 24,064 752(第五代) 96GB GDDR7 ECC 约 1.79 TB/s 约 125 TFLOPS FP4 AI 算力约 4,000 TOPS 级
2025 - GeForce RTX 5090 Blackwell 21,760 680(第五代) 32GB GDDR7 1,792 GB/s 约 105 TFLOPS AI TOPS 约 3,352

这张表怎么看?

Ampere 时代的关键词是“GPU 计算真正普及”。A100 把 MIG、第三代 Tensor Core 和 HBM2e 带到数据中心,RTX 3090 则让个人工作站第一次相对容易地拥有 24GB 显存。对科研用户来说,这一代是很多 CUDA 工作流从服务器走向桌面的起点。

Hopper 的重点不是消费图形,而是大模型和高性能计算。H100/H200 的 FP8、Transformer Engine、更高 HBM 带宽和更强 NVLink,让训练和推理都开始围绕“低精度矩阵计算 + 巨大显存带宽”组织起来。H200 尤其体现了一个事实:很多大模型瓶颈不是算力,而是显存容量和带宽。

Ada Lovelace 横跨消费、工作站和数据中心推理。RTX 4090 的 FP32 峰值非常夸张,RTX 6000 Ada 和 L40S 则把大显存、ECC、虚拟化/企业软件支持放到更重要的位置。它们不一定是训练巨型模型的最优解,但在推理、渲染、仿真和本地实验中很常见。

Blackwell 的变化更偏 AI 基础设施:B200 面向数据中心,把 HBM3e、FP4 和超高 Tensor 吞吐放在中心;RTX 5090 和 RTX PRO 6000 Blackwell 则把 GDDR7、第五代 Tensor Core 和更大的本地显存带到创作者与工作站侧。可以说,2025 之后的 N 卡已经默认生活在 AI 工作负载里了。

几个容易误解的指标

第一,FP32 TFLOPS 不等于深度学习速度。训练和推理更常用 FP16、BF16、FP8 甚至 FP4,真正发挥作用的是 Tensor Core、显存带宽、kernel 实现和框架调度。

第二,显存容量经常比峰值算力更决定体验。能不能放下模型、batch、KV cache 和中间特征,往往比理论 TFLOPS 更实际。H200、B200、RTX PRO 6000 Blackwell 的价值,很大一部分就在“更能装”。

第三,消费卡和数据中心卡不能只按 TFLOPS 横向比较。数据中心卡有 ECC、NVLink、MIG、企业驱动、长时间满载设计和集群互联;消费卡更便宜,但稳定性、显存、互联和软件许可边界都不同。