🟢 The Chronicle of Accelerated Computing · 2006 to 2027

NVIDIA GPU 架构演进史

从 3D 游戏画匠到万亿美元 AI 帝国神皇!看懂黄仁勋如何用 20 年时间,通过 Tensor Core、NVLink、混合精度与机柜光铜革命,重新发明计算机体系结构

💡

5岁核心顿悟:GPU 到底是怎么“从画画变成造物主”的?

像一个专门给上百万个像素涂颜色的小工,最终变成了操纵宇宙引力的矩阵主宰 🎨➔🏛️
起初(2006年前):GPU 只是个死板的画匠,只能死板地算三角形和光影贴图;
黄仁勋的惊天豪赌(CUDA 诞生):给每个小画家装上可以自由编程的微型大脑(通用流式多处理器 SM),让它们不止能算像素,更能算天气预报、物理流体和股票模型;
AI 纪元顿悟(2017 Volta 至今):发现大模型 99% 的数学计算只有一种——矩阵乘累加(Matmul)!于是直接在芯片里塞入专用矩阵狂飙引擎(Tensor Core),从 FP16、FP8 一路下探到 FP4,最终将芯片两两缝合,甚至把一整座机柜变成单张超级巨无霸!

横跨 20 年的三个史诗篇章

从通用计算的探索、深度学习的引爆,到整机柜级超级智能工场

🖥️

第一纪元:通用图形向科学计算蜕变

2006 - 2015 · 奠基时代

Tesla → Fermi → Kepler → Maxwell:诞生统一着色器与 CUDA,引入 IEEE-754 双精度 FP64 和硬件缓存层次。AlexNet 首次在两张消费级 GTX 580 上训出卷积神经网络,推开现代深度学习大门!

第二纪元:AI 专属硬件与张量核心觉醒

2016 - 2020 · 跃迁时代

Pascal → Volta → Turing → Ampere:诞生 NVLink 1.0 与 HBM 高速显存;首创 Tensor Core 张量计算核心,引入 FP16、TF32、BF16 和稀疏化加速,GPU 彻底从“图形卡”蜕变为“AI 计算引擎”。

🏢

第三纪元:大模型超级集群与物理极限突围

2022 - 2027 · 霸权时代

Hopper → Blackwell → Rubin:从 FP8 到 FP4,光刻机面积极限下采用 双 Die 10TB/s 神经缝合 (NV-HBI)。打破单卡形态,以 GB200 NVL72 液冷机柜与 NVL576 重新定义“机柜即单卡”!

📜 历代架构里程碑:每一步都在重塑行业

从 2006 年至今,NVIDIA 每一代核心架构的质变跃迁:

Tesla 2006 年 · G80 通用计算元年
CUDA 诞生! 抛弃固定功能管线,发明统一着色器架构(Unified Shaders)。流式多处理器(SM)首次具备通用编程能力,全球黑客开始尝试用 GPU 跑科学模拟。
Fermi 2010 年 · GF100 科学计算规范
首个真正完备的计算架构! 引入统一 L1/L2 缓存、硬件 ECC 显存纠错、双 Warp 调度器,以及符合 IEEE-754 标准的满血 FP64 双精度浮点。
Kepler / Maxwell 2012 - 2014 年 能效比大跃升
重构 SM 调度(SMX/SMM),每瓦能效提升 2 倍;AlexNet 正是在 Kepler 时代的消费级显卡上震惊世界,直接促使黄仁勋下定决心“All-in AI”。
Pascal 2016 年 · GP100 首款深度学习卡
黄仁勋亲手给 OpenAI 送去第一台 DGX-1! 首次搭载 HBM2 高速堆叠显存NVLink 1.0 片间互联 与原生 FP16 半精度翻倍吞吐
Volta 2017 年 · GV100 Tensor Core 觉醒
改变历史的张量核心(Tensor Core)首发! 8 个专用矩阵乘累加(MMA)单元,单卡吞吐飙升 5 倍;首创独立线程调度,奠定大模型训练底座。
Ampere 2020 年 · GA100 工业级繁荣
A100 封神! 引入 TF32(无需改代码即可享加速)、BF162:4 结构化稀疏 以及 异步内存拷贝 (cp.async),成为全球云厂商标配。
Hopper 2022 年 · GH100 Transformer 引擎
H100/H200 霸权! 单 Die 晶粒达到 800 亿晶体管物理极限;原生 FP8 精度与 Transformer 引擎TMA 异步传输引擎、线程块集群与 NVLink 4。
Blackwell 2024 年 · GB200 机柜即超级芯片
双 Die 10TB/s 神经缝合! 2080 亿晶体管;第二代 Transformer 引擎引入 FP4 极低精度 与 TMEM 张量缓存;GB200 NVL72 全液冷机柜 吞吐暴增 30 倍。
Rubin 2026 - 2027 年 下一代星际要塞
HBM4 与 NVFP4 全新纪元! 首发搭载 HBM4 顶级堆叠显存 与 NVLink 6(3.6TB/s),推出 600kW 全液冷 NVL576 超级集群,单卡算力逼近 100 PFLOPS!

🎯 黄仁勋押注体系结构的五大哲学信条

为什么在各种专用 ASIC、TPU、LPU 的围攻下,NVIDIA 能始终独孤求败?

🎮 1. 坚守软件可编程性 (Programmability)

AI 算法日新月异,ASIC 专用芯片一旦改算法就会变成废铁。NVIDIA 坚持让所有加速单元全部暴露在 CUDA 编程模型之下,始终拥抱最新算法变革。

🧵 2. 用海量并发隐藏延迟 (Massive Multithreading)

内存读取太慢?硬件调度器在同一个 SM 驻留上千个线程(数十个 Warps),只要一个线程在等内存,瞬间切换到就绪线程计算,硬件流水线永不停歇!

🧩 3. 矩阵与通用算子在单 Kernel 融合

Tensor Core 不是独立的固定芯片,而是与 CUDA Core、共享内存无缝协同。使得单一 Kernel 就能同时完成矩阵乘法、Softmax 与残差相加(FlashAttention 核心)。

🌊 4. 异步内存层级解耦 (TMA / TMEM)

从以前线程自己跑去搬数据,进化为 TMA 硬件 DMA 引擎自动搬运,计算核心只管从共享内存和 TMEM 中取数,数据搬运与矩阵计算完全重叠掩盖。

🎮 交互模拟器:推演跨代架构训练 GPT-3 (175B) 所需时间

选择不同时代的旗舰芯片集群,直观感受算力跨越 10 年带来的百倍降维打击: