日记随笔
2020-2026 典型 NVIDIA GPU 架构对比
从 Ampere、Ada Lovelace、Hopper 到 Blackwell,N 卡这几年真正变化的不只是“更快”,而是显存、互联、Tensor Core 精度和软件生态一起变了。
先看一张总表
下表选取的是 2020-2026 年间有代表性的 NVIDIA GPU,而不是穷举所有 SKU。表中把 CUDA Core、Tensor Core、显存、带宽和典型计算峰值拆开列出;不同产品线公开规格口径并不完全一致,因此更适合做架构和代际趋势比较。
| GPU | 架构 | CUDA Core | Tensor Core | 显存 | 带宽 | FP32 峰值 | Tensor / AI 峰值 |
|---|---|---|---|---|---|---|---|
| 2020 - A100 80GB SXM | Ampere | 6,912 | 432(第三代) | 80GB HBM2e | 约 2.0 TB/s | 19.5 TFLOPS | FP16 Tensor 312 TFLOPS;稀疏约 624 TFLOPS |
| 2020 - GeForce RTX 3090 | Ampere | 10,496 | 328(第三代) | 24GB GDDR6X | 936 GB/s | 约 35.6 TFLOPS | 约 285 Tensor TFLOPS(稀疏口径) |
| 2022 - H100 SXM | Hopper | 16,896 | 528(第四代) | 80GB HBM3 | 3.35 TB/s | 67 TFLOPS | FP8 Tensor 3,958 TFLOPS(含稀疏);FP16/BF16 1,979 TFLOPS(含稀疏) |
| 2022 - GeForce RTX 4090 | Ada Lovelace | 16,384 | 512(第四代) | 24GB GDDR6X | 约 1,008 GB/s | 约 82.6 TFLOPS | 约 1,321 Tensor TFLOPS(稀疏口径) |
| 2022 - RTX 6000 Ada | Ada Lovelace | 18,176 | 568(第四代) | 48GB GDDR6 ECC | 960 GB/s | 约 91.1 TFLOPS | 约 1,457 Tensor TFLOPS(稀疏口径) |
| 2023 - L40S | Ada Lovelace | 18,176 | 568(第四代) | 48GB GDDR6 ECC | 864 GB/s | 约 91.6 TFLOPS | FP8 Tensor 1,466 TFLOPS(含稀疏) |
| 2024 - H200 SXM | Hopper | 16,896 | 528(第四代) | 141GB HBM3e | 4.8 TB/s | 67 TFLOPS | FP8 Tensor 3,958 TFLOPS(含稀疏);FP16/BF16 1,979 TFLOPS(含稀疏) |
| 2025 - B200 | Blackwell | 官方未按消费卡口径列出 | 第五代 Tensor Core | 192GB HBM3e | 8.0 TB/s | 75 TFLOPS | FP8 Tensor 9 PFLOPS(含稀疏);FP4 Tensor 18 PFLOPS(含稀疏) |
| 2025 - RTX PRO 6000 Blackwell | Blackwell | 24,064 | 752(第五代) | 96GB GDDR7 ECC | 约 1.79 TB/s | 约 125 TFLOPS | FP4 AI 算力约 4,000 TOPS 级 |
| 2025 - GeForce RTX 5090 | Blackwell | 21,760 | 680(第五代) | 32GB GDDR7 | 1,792 GB/s | 约 105 TFLOPS | AI TOPS 约 3,352 |
这张表怎么看?
Ampere 时代的关键词是“GPU 计算真正普及”。A100 把 MIG、第三代 Tensor Core 和 HBM2e 带到数据中心,RTX 3090 则让个人工作站第一次相对容易地拥有 24GB 显存。对科研用户来说,这一代是很多 CUDA 工作流从服务器走向桌面的起点。
Hopper 的重点不是消费图形,而是大模型和高性能计算。H100/H200 的 FP8、Transformer Engine、更高 HBM 带宽和更强 NVLink,让训练和推理都开始围绕“低精度矩阵计算 + 巨大显存带宽”组织起来。H200 尤其体现了一个事实:很多大模型瓶颈不是算力,而是显存容量和带宽。
Ada Lovelace 横跨消费、工作站和数据中心推理。RTX 4090 的 FP32 峰值非常夸张,RTX 6000 Ada 和 L40S 则把大显存、ECC、虚拟化/企业软件支持放到更重要的位置。它们不一定是训练巨型模型的最优解,但在推理、渲染、仿真和本地实验中很常见。
Blackwell 的变化更偏 AI 基础设施:B200 面向数据中心,把 HBM3e、FP4 和超高 Tensor 吞吐放在中心;RTX 5090 和 RTX PRO 6000 Blackwell 则把 GDDR7、第五代 Tensor Core 和更大的本地显存带到创作者与工作站侧。可以说,2025 之后的 N 卡已经默认生活在 AI 工作负载里了。
几个容易误解的指标
第一,FP32 TFLOPS 不等于深度学习速度。训练和推理更常用 FP16、BF16、FP8 甚至 FP4,真正发挥作用的是 Tensor Core、显存带宽、kernel 实现和框架调度。
第二,显存容量经常比峰值算力更决定体验。能不能放下模型、batch、KV cache 和中间特征,往往比理论 TFLOPS 更实际。H200、B200、RTX PRO 6000 Blackwell 的价值,很大一部分就在“更能装”。
第三,消费卡和数据中心卡不能只按 TFLOPS 横向比较。数据中心卡有 ECC、NVLink、MIG、企业驱动、长时间满载设计和集群互联;消费卡更便宜,但稳定性、显存、互联和软件许可边界都不同。