什么是 GPU 的 SM(流式多处理器)?
显卡算力的最底层独立执行工厂!看懂千个 CUDA 核心如何被编织成 100 多座自动化流水车间,为什么 32 个线程必须步伐一致绑定成 Warp,以及隐蔽内存延迟的终极秘籍!
芯片面积大部分花在庞大的分支预测器(Branch Predictor)和巨额三级缓存上。拥有极高的单核主频(5 GHz+),擅长串行解决各种高难度、充满 if-else 逻辑的复杂事务,但总核心数通常只有 8~64 个,面对海量无脑乘法力不从心。
GPU 的基本算力细胞! 一张 H100 包含 132 个 SM,RTX 4090 包含 128 个 SM。每个 SM 就是一个独立的自动化流水线车间,内含 128 个 CUDA 核心、4 个 Tensor 核心、Warp 调度器、超高速共享内存与寄存器堆,专精“几万个数据同时做同一种乘法计算”!
SM 流式多处理器内部四大核心支柱
从 SIMT 架构、零开销调度到硬件级片上内存层次
1. Warp(线程束)与 SIMT 架构
GPU 从来不单管一个线程!SM 硬件把 32 个线程捆绑为一个 Warp。同一时刻广播一条机器指令,32 个核心同时执行不同的数据(Single Instruction, Multiple Threads)。
2. 零开销 Warp 调度 (Latency Hiding)
CPU 换线程要存盘读盘浪费几百时钟周期;SM 的寄存器大到能把几千个线程的状态全部常驻!Warp A 遇到内存读取延迟,调度器在下一个时钟周期瞬间切到 Warp B,实现无缝隐藏延迟!
3. 超级片上存储:SRAM 寄存器与共享内存
每个 SM 拥有高达 256 KB 物理寄存器堆 和 128~228 KB 的 Shared Memory/L1 缓存,带宽超过数十 TB/s,比外面的显存快 20 倍以上,是大模型 FlashAttention 算子提速的核心秘密。
📊 旗舰显卡 SM 硬件内脏拆解
以 NVIDIA Hopper H100 与 Ada RTX 4090 单颗 SM 为例:
🎮 交互模拟器:推演 SM 车间在不同 CUDA 代码下的运行流水线
点击查看不同编程写法在 SM 车间内部引起的性能变化与瓶颈分析: