🐭 Training Compute-Optimal Large Language Models (DeepMind 2022)

什么是 Chinchilla 论文(算力最优尺度定律)?

DeepMind 震撼全行业的拨乱反正!揭露 GPT-3 等主流大模型全在“饿肚子挨饿(严重欠拟合)”,用 70B 精悍小模型暴打 280B 虚胖怪兽并引爆 LLaMA 革命

旧时代:Kaplan 误区 (饿肚子的虚胖巨人)
🧌🪨 280B 臃肿巨人·只喂了一点点口粮

受 OpenAI Kaplan 早期论文误导,业界普遍认为“算力增加时,73% 的算力应该用来堆参数,只有 27% 用来喂数据”。结果造出了像 Gopher (280B)、GPT-3 (175B) 这种体型庞大却饿得眼冒金星(严重欠训练)的庞然大物,推理又慢又贵!

Gopher 280B: 仅吃 300B Tokens ➔ 严重营养不良 🧌 ❌ 推理显存消耗极大 · 单卡跑不动 · 算力严重虚掷 盲目追求百亿千亿参数,模型根本没学透
❌ 参数巨大 (280B) 却很笨拙 ❌ 数据投喂严重不足 (300B) ❌ 推理延迟高且成本昂贵
VS
新纪元:Chinchilla (吃饱喝足的特种兵)
🥋🍚 70B 精悍刺客·狂吃 1.4 万亿 Tokens

参数缩小到 1/4 (仅 70B),但数据量猛翻 4.6 倍 (吃下 1.4T Tokens)! 在消耗完全相同训练算力的情况下,各领域基准全面秒杀 280B 的 Gopher 和 175B 的 GPT-3,推理部署快 4 倍!

Chinchilla 70B: 狂吃 1400B Tokens ➔ 满血暴击 🥋 ✔ 同等训练算力下 · 全方位吊打 280B Gopher 与 GPT-3 ⚡ 推理速度快 4 倍 · 显存减半 · 催生了 LLaMA 盛世
✅ 算力最优分配 (1:1 等比增长) ✅ 黄金比例 Tokens:Params ≈ 20:1 🚀 开源 LLaMA / Mistral 的精神导师
💡

5岁核心顿悟:为什么说 Chinchilla 挽救了开源大模型?

像“培养一个神童”的道理 👶📚
• 以前大家以为“脑袋越大越聪明”(疯狂堆参数到 280B),但只让他读了 10 本书(300B Tokens),这叫大脑很大但营养严重不良的虚胖怪兽
DeepMind 的 Chinchilla 论文一语惊醒梦中人:脑袋只要正常大小(70B),但给他读 100 本顶级书籍(1.4T Tokens)!神童的悟性和智商直接爆表,而且脑袋小了,日常走路思考(推理部署)省电又敏捷
Meta 看了这篇论文大受启发:立刻照着这个思路搞出了 7B/13B/70B 并狂喂数十万亿 Token 的 LLaMA,让普通人的单张显卡也能跑顶级开源模型!

Chinchilla 定律的三大颠覆性发现

打破旧经验法则,确立现代大模型训练的黄金圣经

⚖️

1. 参数与数据应该 1:1 等比例增长

Kaplan 早期认为参数增加速度应是数据的 3 倍;而 Chinchilla 通过严密的 400 多个模型实验证明:算力预算增加 10 倍时,参数量 $N$ 和训练 Token $D$ 应当各增加约 3.16 倍(各自占据 50% 增量,即 $a=b\approx 0.5$)

📊

2. 黄金法则:Tokens:Params ≈ 20:1

想要在训练预算内榨干每一分算力潜能,训练 Token 数量至少应当是模型参数量的 20 倍!70B 的模型至少要喂 1.4T Tokens,过去喂 300B 就收工的 GPT-3 简直是暴殄天物。

🏎️

3. 推理成本(Inference Cost)的降维胜利

训练只是一次性的,但部署上线后每天要被调用上亿次。小模型(70B)比大模型(280B)省下 75% 的显存与推理延迟。Chinchilla 为“训练时多跑几圈,上线后长久省钱”指明了方向。

📐 严谨数学推导:Kaplan 到底错在哪儿了?

DeepMind 指出了 Kaplan 实验中的致命瑕疵:学习率调度(LR Schedule)没有随着不同步长重新调整对齐!

OpenAI Kaplan (2020) 的推导结果
$$N \propto C^{0.73}, \quad D \propto C^{0.27}$$ $$\text{参数增长速度} \gg \text{数据增长速度}$$

错误原因: Kaplan 团队在训练较短步数的小模型时,使用了固定的余弦学习率衰减(未能让每个模型在目标步数刚好退火到最小值),导致严重低估了增加数据量带来的持续降损收益

DeepMind Chinchilla (2022) 修正结果
$$N \propto C^{0.50}, \quad D \propto C^{0.50}$$ $$\text{参数与数据} \text{ 严格等比例 (1:1) 同步扩张}$$

拨乱反正: 对每个候选配置都独立微调学习率调度。最终证明:当算力翻倍时,参数和数据应该各乘以 $\sqrt{2} \approx 1.414$,两者地位平起平坐!

🎮 交互模拟器:三场历史级对决沙盘重演

在相同的计算预算(FLOPs)下,点击查看不同训练哲学造就的模型实力对比: