🧠 ARMv9 · Neoverse V2 · 900 GB/s NVLink-C2C · Grace CPU

什么是 NVIDIA Grace CPU

英伟达彻底颠覆服务器架构的“超级大脑”!看懂老黄为什么自己造 CPU、如何用 900GB/s NVLink-C2C 消除内存墙,以及 Grace Hopper 与 Grace Superchip 统治 AI 时代的全景图解

传统模式: x86 CPU + PCIe 插卡 GPU
👴🐌 隔着泥泞窄巷喊话的老管家

CPU 住在 x86 主板上,GPU 插在遥远的 PCIe 插槽里。两者通信必须走狭窄的 PCIe 5.0 通道 (仅 64 GB/s 双向 128 GB/s)。每次 GPU 要拿数据,都要向 CPU 提交漫长申请并来回拷贝,巨算力被生生卡死在数据传输瓶颈上

❌ PCIe 5.0 严重塞车 (64GB/s) ❌ 内存独立孤岛,拷贝延迟高 ❌ x86 传统功耗大户 (发热剧烈)
VS
NVIDIA Grace: 超级 ARM + NVLink-C2C 统一内存
🧠⚡ 并排共用一张光速书桌的合体超人

英伟达首款自研数据中心 CPU! 搭载 72 个高性能 ARM Neoverse V2 核心。通过 NVLink-C2C 极速互联(高达 900 GB/s,比 PCIe 5.0 快 7 倍以上!) 与 Hopper GPU 或另一颗 Grace 紧密相连,CPU 与 GPU 共享无缝统一内存空间

✅ 900 GB/s NVLink-C2C 吞吐 ✅ 500GB+ 统一连贯内存网格 ✅ 500W 双芯超高能效比 (节能 2x)
💡

5岁核心顿悟:英伟达明明卖显卡(GPU)独步天下,为什么非要自己造 CPU?

因为 GPU 跑得太快,被传统的 x86 CPU 严重‘拖了后腿’ 🐢💥
• 以前的大模型只有几亿参数,PCIe 传输还能应付;但现在万亿参数、海量 RAG 知识库与百万 Context 大爆发,GPU 自己的 HBM 显存(80GB~144GB)很快就被塞爆!
• 显卡一旦想去借用 CPU 的大内存,就会被传统 PCIe 接口堵成严重便秘。无论 GPU 算力多强,都在傻傻‘等数据喂饭’!
Grace CPU 的诞生,是给 GPU 配上了一个‘孪生兄弟’ 👬✨
• Grace 是专门为喂饱 GPU 而生的定制芯片!它用 900 GB/s 的超宽光速大门把 CPU 内存和 GPU 显存打通成同一个无缝大池子。GPU 抓取 CPU 内存里的数据就像从自己兜里拿糖一样快!

NVIDIA Grace CPU 统治 AI 计算中心的三大杀手锏

从芯片级互联协议、极致内存带宽到 ARM 原生超高能效比

1. NVLink-C2C 芯片级 900 GB/s 互联

能效比 PCIe 5.0 高 5 倍,带宽快 7 倍!支持完全的缓存一致性(Cache Coherent),GPU 与 CPU 之间直接寻址读写,彻底消灭了繁重的 CPU-GPU 驱动拷贝开销。

🌊

2. LPDDR5X 服务器内存与 1 TB/s 带宽

业界首次在数据中心级 CPU 上大规模采用低功耗 LPDDR5X 内存!单颗 Grace 可达 546 GB/s 带宽,双颗 Superchip 突破 1 TB/s,耗电却只有传统 DDR5 服务器的一半!

🛡️

3. 72 核 ARM Neoverse V2 与 Scalable Mesh

支持 ARMv9 架构与 SVE2 矢量扩展指令集。芯片内部由 3.2 TB/s 超高带宽双向环形网格(SCF Mesh Fabric) 将 72 个核心与 117MB L3 缓存连接,多线程并发调度零延迟。

📊 核心规格拆解:Grace CPU 与双形态超级芯片

为 AI 训练推理与 HPC 高性能计算量身定制的双子形态:

核心架构与制程
72 核心
ARM Neoverse V2 · TSMC 4N 工艺
芯片间互联带宽
900 GB/s
NVLink-C2C · 延迟极低·原生一致性
内存容量与带宽
Up to 1 TB/s
LPDDR5X ECC 内存 · 最大 960GB
能效优势
2x 能效比
相比同时代顶级 x86 服务器节能 50%

🎮 交互模拟器:推演不同计算形态下的 Grace 威力

点击查看 Grace 芯片在不同实战配置下的架构流水线与性能表现: