← 返回 ELI5 图解知识库首页
GOOGLE AI & HARDWARE CHIPS
🧩 TENSOR PROCESSING UNIT EXPLAINER
什么是 Google TPU(张量处理单元)?
一句话搞懂:它是 Google 专为 AI 算术铺设的“超音速矩阵高铁网络” —— 数据像血液一样在芯片内部直通脉动,不用反复往返内存,比普通芯片提速数十倍!
❌ 传统通用计算 (CPU / 一般指令)
走走停停的搬运工
每算一次乘法,就要把数字从内存搬到寄存器,算完再搬回内存(遭遇内存墙)
三层 for 循环
频繁访问内存 (慢)
功耗被总线浪费
VS
✅ Google TPU 脉动阵列
心跳直通的流水线矩阵网
几万个乘加单元紧密相连,数据如波浪般流过,零等待直接输出结果!
脉动阵列 (Systolic Array)
零内存往返延迟
支撑 Gemini 与 AlphaGo
🧩 TPU 领跑业界的独家三大魔法
1. 脉动阵列 (Systolic Array)
像心脏泵血一样,数据每跳动一个时钟周期就向右推进一步,权重向下推进一步。乘法和加法在途中完成,绝不向内存多要一次读写。
2. 自研 bfloat16 数字格式
Google 独创的 16 位浮点数:只用传统 32 位浮点数一半的内存,却保留了相同的动态范围。如今已经成为全球 AI 芯片的标准规范!
3. 光交换机 TPU Pod 超级集群
使用光路交换机(OCS)将数万颗 TPU 芯片通过光纤直连成一台超大型巨无霸计算机,训练万亿参数的 Gemini 模型如履平地。
🧩 交互模拟:TPU 矩阵脉动流水线 (Systolic Array)
点击选择不同场景,观察数据与权重如何在 3×3 硬件乘加单元(MAC)中流动并实时相撞计算
⬇ 权重向量 Matrix W (向下滑落)
数据流 X ➔
MAC (0,0)
0.00
0.00
MAC (0,1)
0.00
0.00
MAC (0,2)
0.00
0.00
MAC (1,0)
0.00
0.00
MAC (1,1)
0.00
0.00
MAC (1,2)
0.00
0.00
MAC (2,0)
0.00
0.00
MAC (2,1)
0.00
0.00
MAC (2,2)
0.00
0.00
➔ 输出 Y (直通输出)
⚡ 状态: 流水线脉动中 · 吞吐率 100%
🚀 深入探索:Google TPU 的前世今生
代际演进
从 TPU v1 到 TPU v5p
初代 TPU 仅用于推理(驱动 AlphaGo 击败李世石);如今 TPU v5p 已是性能巨兽,单 Pod 拥有 8,960 颗芯片,是 Google 打造前沿 Gemini 的中流砥柱。
- TPU v1: 首创脉动阵列 ASIC
- TPU v2/v3: 加入液冷与训练支持
- TPU v5e/v5p: 性价比与千亿模型旗舰
行业标准
改变世界的 bfloat16
在 TPU 之前,大家都在用复杂的 FP32/FP16。Google 工程师创造性截断尾数提出 bfloat16,既保证了训练不溢出,又大幅砍掉显存占用,如今全行业争相采用。
- 指数位保持与 FP32 一致(8 bits)
- 硬件芯片面积大幅缩减
- 大模型训练零精度损失
网络黑科技
OCS 光路动态互联
传统数据中心使用耗电巨大的电交换机;Google 在 TPU 集群里直接用微型反射镜折射激光(OCS),动态调整网络拓扑,即使坏了芯片也能毫秒重构!
- 光速超低互联延迟
- 节省数据中心 40% 网络功耗
- 近万卡万无一失的训练稳定性