什么是 Kaplan Scaling Laws(大模型尺度定律)?
OpenAI 2020 年奠定千亿大模型信仰的历史级论文!揭秘为什么只要“暴力堆叠参数、算力与数据”,AI 模型的损失率就会像牛顿万有引力一样精准直线暴跌!
在 2020 年前,训练神经网络被戏称为“炼丹”。大家盲目调学习率、改网络层数。没有任何公式能预测模型做大后效果究竟如何,没人敢赌上几千万美元去租上万张 GPU。
Jared Kaplan 等人用数学证明:大模型的性能与参数量 $N$、数据量 $D$、计算量 $C$ 呈强幂律关系(Power Law)! 在对数坐标轴上是一条极其工整的平直斜线,效果可被提前精确计算到小数点后两位!
Kaplan 尺度定律的三大核心结论
参数、数据与架构无关性:物理学式的优雅简洁
1. 跨越数量级的优美幂律 (Power Law)
性能提升与网络架构的微调(比如做更深还是更宽、注意力头数多少)关系极小!决定智商高低的只有三大要素:参数量 $N$、数据量 $D$ 和总算力 $C$。
2. 优先扩大参数(“大模型浅训练”)
Kaplan 在 2020 年指出:算力增加时,扩大模型参数规模的收益远高于增加数据量(推荐将 73% 的算力增长用来扩模型,仅 27% 用来扩数据)。这直接启发了 1750 亿参数的 GPT-3。
3. 小模型精准预测超级大模型
只需在 10M、100M、1B 的极小模型上跑几台 GPU 跑出点位,在双对数坐标轴上一连线,就能在几十亿美元开销之前,提前 6 个月预知 GPT-4 的最终损失率!
📐 尺度定律的核心公式图解
测试集交叉熵损失(Cross-Entropy Loss)$L$ 与各要素之间的数学关系:
$\alpha_N \approx 0.076$。参数每放大,模型的潜在表征容量指数级上升。
$\alpha_D \approx 0.095$。只要不重复过拟合,见识的数据越多,泛化损失越低。
$\alpha_C \approx 0.050$。算力是硬通货,每一万张 H100 燃烧的都是不可逆的确定性进步。
2022 年 DeepMind 发现 Kaplan 定律由于训练提前停止等原因,低估了数据的重要性。DeepMind 的 Chinchilla 定律 证明:参数量和训练 Token 应该等比例(1:1)增加!这直接启发了后来用 15 万亿 Token 充分训练较小模型的 LLaMA 系列!
🎮 交互模拟器:推演大模型在不同算力下的损失与智商
滑动或选择不同的训练算力级别,感受幂律直线在真实物理世界中的推演威力: