什么是 TFLOPS(每秒万亿次浮点运算)?
衡量现代芯片计算肌肉的终极金标准!看懂 1 TFLOPS 到底有多快、为什么同是一张显卡算 FP4 比 FP32 快上 8 倍,以及大模型时代的算力天梯!
计算带有小数点的乘法(比如 3.14159 × 2.71828),一个人需要大约 10 秒钟;即使是极速的传统双核 CPU,一秒钟也只能做几亿次(几百 GFLOPS)带小数点的复杂计算,面对神经网络千万个矩阵乘法,当场计算瘫痪!
Tera Floating-Point Operations Per Second! 1 TFLOPS 代表一秒钟执行 1,000,000,000,000(一万亿)次浮点计算!一张普通的 RTX 4070 拥有约 30 TFLOPS FP32 算力,而顶级 AI 训练卡借助 Tensor 核心与 FP8/FP4 压缩精度,单卡算力直接飙升到 1,000 ~ 2,000 TFLOPS(1~2 PFLOPS!)
读懂算力指标的三把标尺
从字冠天梯、精度折算到真实 MFU 算力利用率
1. 算力字冠天梯 (G → T → P → E)
逢千进一的算力阶梯:Giga (十亿) → Tera (万亿, 10¹²) → Peta (千万亿/拍, 10¹⁵) → Exa (百亿亿/艾, 10¹⁸)!现代千卡集群直接迈入 EFLOPS 时代!
2. 精度与吞吐的反比规律
同样的芯片硬件面积:FP64 (双精度科学计算) < FP32 (图形物理渲染) < BF16/FP16 (大模型传统训练) < FP8/FP4 (大模型高并发微缩推理)!
3. 理论峰值 vs 真实 MFU 利用率
宣传单上的 1000 TFLOPS 是显卡满负荷做最纯粹乘法的理论值。真实跑大模型时,受限于显存搬运与网络通信,实际利用率(MFU)通常在 40%~60% 左右。
📊 算力天梯图谱:主流硬件各精度 TFLOPS 实测对照
一目了然看懂不同硬件在不同场景下的算力输出:
🎮 交互模拟器:推演大模型在不同算力档位与精度下的生成速度
点击查看 70B 大模型在不同 TFLOPS 算力供给与精度模式下的每秒吐字表现: