返回 ELI5 图解知识库首页 GOOGLE AI & HARDWARE CHIPS
🧩 TENSOR PROCESSING UNIT EXPLAINER

什么是 Google TPU(张量处理单元)?

一句话搞懂:它是 Google 专为 AI 算术铺设的“超音速矩阵高铁网络” —— 数据像血液一样在芯片内部直通脉动,不用反复往返内存,比普通芯片提速数十倍!
❌ 传统通用计算 (CPU / 一般指令)

走走停停的搬运工

每算一次乘法,就要把数字从内存搬到寄存器,算完再搬回内存(遭遇内存墙)
💾 内存 算术单元 for i 循环 反复等待读写
三层 for 循环 频繁访问内存 (慢) 功耗被总线浪费
VS
✅ Google TPU 脉动阵列

心跳直通的流水线矩阵网

几万个乘加单元紧密相连,数据如波浪般流过,零等待直接输出结果
数据流 ➔ 权重流 ⬇ ➔ 结果
脉动阵列 (Systolic Array) 零内存往返延迟 支撑 Gemini 与 AlphaGo
💡

核心真理:Google 早在 2015 年就预见到了 AI 时代的算力爆炸!

当时 Google 发现,如果全人类每天只用 3 分钟语音搜索,Google 的数据中心服务器就得翻倍。于是 Google 秘密研发了 TPU(张量处理单元):把神经网络最耗时的“矩阵相乘”直接固化在硬件网格里,开启了长达十年的自研芯片传奇!

🧩 TPU 领跑业界的独家三大魔法

🫀

1. 脉动阵列 (Systolic Array)

像心脏泵血一样,数据每跳动一个时钟周期就向右推进一步,权重向下推进一步。乘法和加法在途中完成,绝不向内存多要一次读写。

🎯

2. 自研 bfloat16 数字格式

Google 独创的 16 位浮点数:只用传统 32 位浮点数一半的内存,却保留了相同的动态范围。如今已经成为全球 AI 芯片的标准规范!

🌐

3. 光交换机 TPU Pod 超级集群

使用光路交换机(OCS)将数万颗 TPU 芯片通过光纤直连成一台超大型巨无霸计算机,训练万亿参数的 Gemini 模型如履平地。

🧩 交互模拟:TPU 矩阵脉动流水线 (Systolic Array)

点击选择不同场景,观察数据与权重如何在 3×3 硬件乘加单元(MAC)中流动并实时相撞计算

⬇ 权重向量 Matrix W (向下滑落)
数据流 X ➔
MAC (0,0)
0.00
MAC (0,1)
0.00
MAC (0,2)
0.00
MAC (1,0)
0.00
MAC (1,1)
0.00
MAC (1,2)
0.00
MAC (2,0)
0.00
MAC (2,1)
0.00
MAC (2,2)
0.00
➔ 输出 Y (直通输出)
⚡ 状态: 流水线脉动中 · 吞吐率 100%

当前任务场景

Gemini 2.0 Flash 多模态注意力矩阵

硬件单周期算力

128 × 128 = 16,384 次乘加/周期

能效与内存开销

零 DRAM 访问 · 能效比提升 7.8×

💡 原理说明: 数据在矩阵内部流动,算完的值直接给隔壁邻居用,彻底消除了访问内存带来的发热和延迟。

🚀 深入探索:Google TPU 的前世今生

代际演进

从 TPU v1 到 TPU v5p

初代 TPU 仅用于推理(驱动 AlphaGo 击败李世石);如今 TPU v5p 已是性能巨兽,单 Pod 拥有 8,960 颗芯片,是 Google 打造前沿 Gemini 的中流砥柱。

  • TPU v1: 首创脉动阵列 ASIC
  • TPU v2/v3: 加入液冷与训练支持
  • TPU v5e/v5p: 性价比与千亿模型旗舰
行业标准

改变世界的 bfloat16

在 TPU 之前,大家都在用复杂的 FP32/FP16。Google 工程师创造性截断尾数提出 bfloat16,既保证了训练不溢出,又大幅砍掉显存占用,如今全行业争相采用。

  • 指数位保持与 FP32 一致(8 bits)
  • 硬件芯片面积大幅缩减
  • 大模型训练零精度损失
网络黑科技

OCS 光路动态互联

传统数据中心使用耗电巨大的电交换机;Google 在 TPU 集群里直接用微型反射镜折射激光(OCS),动态调整网络拓扑,即使坏了芯片也能毫秒重构!

  • 光速超低互联延迟
  • 节省数据中心 40% 网络功耗
  • 近万卡万无一失的训练稳定性