返回 ELI5 知识库首页 🔴 ASCEND AI COMPUTING
🔴 Huawei Ascend · DaVinci NPU Architecture

什么是 华为 NPU(昇腾芯片)?

GPU 就像一把“多功能电动瑞士军刀”,既能画游戏贴图也能顺便算矩阵;而华为 NPU(神经网络处理器)则是“专为 AI 矩阵打造的液压冲压机” —— 扔掉一切不必要的图形包袱,以 3D Cube 架构一击压出千亿参数运算!

🎮 GPU:图形兼顾 AI 的多面手

传承自 3D 渲染的通用架构

硬件中保留了光栅化、纹理贴图、多边形光影等专用图形电路。虽然算力强大,但对纯 AI 任务来说有部分历史硬件冗余。

通用 GPU 军刀 3D贴图/光追 视频编解码 AI 矩阵运算
  • 🔹 历史血统:脱胎于 PC 游戏显卡与 3D 图形渲染
  • 🔹 灵活性强:不仅能训大模型,还能接显示器打《黑神话:悟空》
  • 🔹 软硬件生态:拥有 20 年构筑的成熟 CUDA 开发者生态
VS
🔴 华为 NPU:纯粹为 AI 神经网络而生 (ASIC)

自研达芬奇 3D Cube 架构

剥离一切多余图形显示模块,直奔大模型最核心的 3D 矩阵乘法($16 \times 16 \times 16$),以极高能效比实现极致吞吐!

3D Cube 16×16×16 ⚡ 单周期完成 4096 次乘加运算
  • 🔴 纯粹 AI 基因:专为神经网络前向推理与反向传播定制
  • 🔴 达芬奇架构:Cube(矩阵)+ Vector(向量)+ Scalar(标量)三合一
  • 🔴 全自主栈:昇腾芯片 + CANN 异构软件 + MindSpore 框架闭环
💡

一句话顿悟:华为昇腾 NPU 的突破意义是什么?

如果把 AI 大模型比作一座由海量砖块堆成的摩天大楼,普通处理器是“一块砖一块砖砌”; 而华为 NPU 的 3D Cube 则是“预制集装箱压模机” —— 每次直接把 $16 \times 16 \times 16$ 的整块立体矩阵压铸成型,实现了国产自主 AI 算力的高效突破!

解剖华为达芬奇(DaVinci)架构 4 大支柱

从三维计算魔方到全栈软件底座,读懂昇腾芯片的硬核实力

🧊

1. 3D Cube 矩阵核心

达芬奇架构的心脏。硬件级专攻 $16 \times 16 \times 16$ 矩阵乘法,一个时钟周期即可完成 4096 次 FP16 乘加运算(MAC)。

📏

2. Vector 向量 & Scalar 标量

矩阵算完后,由 Vector 单元负责 Softmax、ReLU 激活函数等一维向量运算,Scalar 负责指令控制与分支流。

🔗

3. CANN 异构计算架构

对标英伟达 CUDA 的软件中枢。负责向下释放芯片极致算力,向上兼容 PyTorch、MindSpore 和主流大模型框架。

🌐

4. 昇腾万里集群互联

通过 RoCE 2.0 高速网络与集群编排,将数万张昇腾 910 芯片互联,构建支撑万亿参数盘古大模型的大算力底座。

🕹️ 达芬奇 3D Cube 矩阵压铸演练台

观察 $16 \times 16$ 神经元权重如何在 3D Cube 中被瞬间“压铸”完成:

DaVinci Matrix Array (16×16 Block)

CUBE CORE: READY FOR DISPATCH
运算模式: FP16 混合精度 (训练加速)
单周期乘加吞吐: 4,096 MACs / Cycle
硬件单元状态: Cube (活跃) · Vector (待命) · Scalar (调度)
🌟 算力版图

从端侧到云端的全场景覆盖

华为昇腾 NPU 覆盖了从手机端侧(麒麟芯片内置轻量 NPU)、边缘计算(昇腾 310)到超算中心大模型训练(昇腾 910 系列)的全谱系。

同一套达芬奇架构在不同算力规模间无缝伸缩,实现“端-边-云”协同。

🏰 软件护城河

CANN:打破 CUDA 垄断的突围之路

做芯片最难的是软件生态。华为自研的 CANN(Compute Architecture for Neural Networks) 提供了数千个极致优化的算子库。

让全球开源社区的 PyTorch 模型无需繁琐重构,就能直接迁移到昇腾算力平台上流畅运行。

🛡️ 战略自主

大模型时代的“国产根基”

在地缘政治与算力管制的背景下,拥有完全自主知识产权的架构与生态至关重要。

昇腾 NPU 为国内政企、金融、科研与大模型创业者提供了除通用 GPU 外极具竞争力的“第二种强大选择”