🧮 Floating Point Compute · FLOPS / TFLOPS / PFLOPS · Precision Scaling

什么是 TFLOPS(每秒万亿次浮点运算)?

衡量现代芯片计算肌肉的终极金标准!看懂 1 TFLOPS 到底有多快、为什么同是一张显卡算 FP4 比 FP32 快上 8 倍,以及大模型时代的算力天梯

人类脑力 / 传统 CPU
🧠🐌 手拿草稿纸默默点算的小学生

计算带有小数点的乘法(比如 3.14159 × 2.71828),一个人需要大约 10 秒钟;即使是极速的传统双核 CPU,一秒钟也只能做几亿次(几百 GFLOPS)带小数点的复杂计算,面对神经网络千万个矩阵乘法,当场计算瘫痪

❌ 算力停留在 GFLOPS 级别 ❌ 串行排队计算,吞吐量极小 ❌ 无法承担图形渲染与 AI 推理
VS
现代 GPU 算力矩阵: TFLOPS ~ PFLOPS
🧮⚡ 一秒钟刷完一万亿道算式的高斯超人

Tera Floating-Point Operations Per Second! 1 TFLOPS 代表一秒钟执行 1,000,000,000,000(一万亿)次浮点计算!一张普通的 RTX 4070 拥有约 30 TFLOPS FP32 算力,而顶级 AI 训练卡借助 Tensor 核心与 FP8/FP4 压缩精度,单卡算力直接飙升到 1,000 ~ 2,000 TFLOPS(1~2 PFLOPS!)

✅ 一秒万亿次浮点矩阵狂飙 ✅ 数千个小核心成千上万路并发 ⭐ 精度越低,算力翻倍暴涨
💡

5岁核心顿悟:为什么经常看到‘FP32 只有 30 TFLOPS,但 FP8 能到 1000 TFLOPS’?

算数的‘数字字长’决定了计算速度 📐✨
FP32(单精度):好比每个数字都写成 32 位的长长一长串(比如 3.1415926535...),极度精准,画 3D 游戏必须用它才不会穿模;但每次乘法要耗费很多晶体管电路,速度慢;
FP8 / FP4(低精度):好比算 AI 神经网络时,把数字四舍五入简化成只有 8 位甚至 4 位短数字(比如 3.14)!
神奇的物理规律出现了 ⚡🚀
• 原本算 1 个大数字的电路,现在可以同时并行算 4 个甚至 8 个小数字!所以显卡算力直接从 30 暴增到 1,000 TFLOPS!大模型不仅不在乎这点微小的精度损失,速度还能翻好几倍!

读懂算力指标的三把标尺

从字冠天梯、精度折算到真实 MFU 算力利用率

🪜

1. 算力字冠天梯 (G → T → P → E)

逢千进一的算力阶梯:Giga (十亿) → Tera (万亿, 10¹²) → Peta (千万亿/拍, 10¹⁵) → Exa (百亿亿/艾, 10¹⁸)!现代千卡集群直接迈入 EFLOPS 时代!

🎯

2. 精度与吞吐的反比规律

同样的芯片硬件面积:FP64 (双精度科学计算) < FP32 (图形物理渲染) < BF16/FP16 (大模型传统训练) < FP8/FP4 (大模型高并发微缩推理)!

⚠️

3. 理论峰值 vs 真实 MFU 利用率

宣传单上的 1000 TFLOPS 是显卡满负荷做最纯粹乘法的理论值。真实跑大模型时,受限于显存搬运与网络通信,实际利用率(MFU)通常在 40%~60% 左右。

📊 算力天梯图谱:主流硬件各精度 TFLOPS 实测对照

一目了然看懂不同硬件在不同场景下的算力输出:

PS5 / Xbox 游戏主机
10~12 TFLOPS
FP32 · 畅玩 4K 60帧游戏
RTX 4090 旗舰显卡
83 TFLOPS
FP32 图形算力 · 消费级天花板
NVIDIA H100 SXM
1,979 TFLOPS
FP8 Tensor Core · AI 训练硬通货
Huawei 昇腾 950DT
2,007 TFLOPS
MXFP4 算力 · 36组 Cube 核心

🎮 交互模拟器:推演大模型在不同算力档位与精度下的生成速度

点击查看 70B 大模型在不同 TFLOPS 算力供给与精度模式下的每秒吐字表现: