NVIDIA GPU 架构演进史
从 3D 游戏画匠到万亿美元 AI 帝国神皇!看懂黄仁勋如何用 20 年时间,通过 Tensor Core、NVLink、混合精度与机柜光铜革命,重新发明计算机体系结构!
横跨 20 年的三个史诗篇章
从通用计算的探索、深度学习的引爆,到整机柜级超级智能工场
第一纪元:通用图形向科学计算蜕变
Tesla → Fermi → Kepler → Maxwell:诞生统一着色器与 CUDA,引入 IEEE-754 双精度 FP64 和硬件缓存层次。AlexNet 首次在两张消费级 GTX 580 上训出卷积神经网络,推开现代深度学习大门!
第二纪元:AI 专属硬件与张量核心觉醒
Pascal → Volta → Turing → Ampere:诞生 NVLink 1.0 与 HBM 高速显存;首创 Tensor Core 张量计算核心,引入 FP16、TF32、BF16 和稀疏化加速,GPU 彻底从“图形卡”蜕变为“AI 计算引擎”。
第三纪元:大模型超级集群与物理极限突围
Hopper → Blackwell → Rubin:从 FP8 到 FP4,光刻机面积极限下采用 双 Die 10TB/s 神经缝合 (NV-HBI)。打破单卡形态,以 GB200 NVL72 液冷机柜与 NVL576 重新定义“机柜即单卡”!
📜 历代架构里程碑:每一步都在重塑行业
从 2006 年至今,NVIDIA 每一代核心架构的质变跃迁:
🎯 黄仁勋押注体系结构的五大哲学信条
为什么在各种专用 ASIC、TPU、LPU 的围攻下,NVIDIA 能始终独孤求败?
🎮 1. 坚守软件可编程性 (Programmability)
AI 算法日新月异,ASIC 专用芯片一旦改算法就会变成废铁。NVIDIA 坚持让所有加速单元全部暴露在 CUDA 编程模型之下,始终拥抱最新算法变革。
🧵 2. 用海量并发隐藏延迟 (Massive Multithreading)
内存读取太慢?硬件调度器在同一个 SM 驻留上千个线程(数十个 Warps),只要一个线程在等内存,瞬间切换到就绪线程计算,硬件流水线永不停歇!
🧩 3. 矩阵与通用算子在单 Kernel 融合
Tensor Core 不是独立的固定芯片,而是与 CUDA Core、共享内存无缝协同。使得单一 Kernel 就能同时完成矩阵乘法、Softmax 与残差相加(FlashAttention 核心)。
🌊 4. 异步内存层级解耦 (TMA / TMEM)
从以前线程自己跑去搬数据,进化为 TMA 硬件 DMA 引擎自动搬运,计算核心只管从共享内存和 TMEM 中取数,数据搬运与矩阵计算完全重叠掩盖。
🎮 交互模拟器:推演跨代架构训练 GPT-3 (175B) 所需时间
选择不同时代的旗舰芯片集群,直观感受算力跨越 10 年带来的百倍降维打击: