什么是 Chinchilla 论文(算力最优尺度定律)?
DeepMind 震撼全行业的拨乱反正!揭露 GPT-3 等主流大模型全在“饿肚子挨饿(严重欠拟合)”,用 70B 精悍小模型暴打 280B 虚胖怪兽并引爆 LLaMA 革命!
受 OpenAI Kaplan 早期论文误导,业界普遍认为“算力增加时,73% 的算力应该用来堆参数,只有 27% 用来喂数据”。结果造出了像 Gopher (280B)、GPT-3 (175B) 这种体型庞大却饿得眼冒金星(严重欠训练)的庞然大物,推理又慢又贵!
参数缩小到 1/4 (仅 70B),但数据量猛翻 4.6 倍 (吃下 1.4T Tokens)! 在消耗完全相同训练算力的情况下,各领域基准全面秒杀 280B 的 Gopher 和 175B 的 GPT-3,推理部署快 4 倍!
Chinchilla 定律的三大颠覆性发现
打破旧经验法则,确立现代大模型训练的黄金圣经
1. 参数与数据应该 1:1 等比例增长
Kaplan 早期认为参数增加速度应是数据的 3 倍;而 Chinchilla 通过严密的 400 多个模型实验证明:算力预算增加 10 倍时,参数量 $N$ 和训练 Token $D$ 应当各增加约 3.16 倍(各自占据 50% 增量,即 $a=b\approx 0.5$)!
2. 黄金法则:Tokens:Params ≈ 20:1
想要在训练预算内榨干每一分算力潜能,训练 Token 数量至少应当是模型参数量的 20 倍!70B 的模型至少要喂 1.4T Tokens,过去喂 300B 就收工的 GPT-3 简直是暴殄天物。
3. 推理成本(Inference Cost)的降维胜利
训练只是一次性的,但部署上线后每天要被调用上亿次。小模型(70B)比大模型(280B)省下 75% 的显存与推理延迟。Chinchilla 为“训练时多跑几圈,上线后长久省钱”指明了方向。
📐 严谨数学推导:Kaplan 到底错在哪儿了?
DeepMind 指出了 Kaplan 实验中的致命瑕疵:学习率调度(LR Schedule)没有随着不同步长重新调整对齐!
错误原因: Kaplan 团队在训练较短步数的小模型时,使用了固定的余弦学习率衰减(未能让每个模型在目标步数刚好退火到最小值),导致严重低估了增加数据量带来的持续降损收益!
拨乱反正: 对每个候选配置都独立微调学习率调度。最终证明:当算力翻倍时,参数和数据应该各乘以 $\sqrt{2} \approx 1.414$,两者地位平起平坐!
🎮 交互模拟器:三场历史级对决沙盘重演
在相同的计算预算(FLOPs)下,点击查看不同训练哲学造就的模型实力对比: