📈 The Mathematical Foundation of the LLM Revolution

什么是 Kaplan Scaling Laws(大模型尺度定律)?

OpenAI 2020 年奠定千亿大模型信仰的历史级论文!揭秘为什么只要“暴力堆叠参数、算力与数据”,AI 模型的损失率就会像牛顿万有引力一样精准直线暴跌

传统机器学习时期 (玄学炼丹盲人摸象)
🧙‍♂️🔮 靠天吃饭·没人敢花一千万美元

在 2020 年前,训练神经网络被戏称为“炼丹”。大家盲目调学习率、改网络层数。没有任何公式能预测模型做大后效果究竟如何,没人敢赌上几千万美元去租上万张 GPU。

盲目摸索: 调参如同玄学抽奖 🎲 ❌ 无法科学预测产出 · 投资人不敢巨额押注 学术界普遍停留在数千万到几亿参数的微型玩具
❌ 性能完全无法事先预测 ❌ 频繁遭遇过拟合与边际递减 ❌ 算力资源严重浪费
VS
Kaplan 定律 (双对数坐标下的绝对直线)
📐⚡ 物理学般的确定性规律与宏伟蓝图

Jared Kaplan 等人用数学证明:大模型的性能与参数量 $N$、数据量 $D$、计算量 $C$ 呈强幂律关系(Power Law)! 在对数坐标轴上是一条极其工整的平直斜线,效果可被提前精确计算到小数点后两位

双对数图上的完美直线: L(C) ∝ C^(-α_C) 📉 ✔ 用小模型画斜线 ➔ 精准推导出百亿/千亿模型的智商! ⚡ 催生了 GPT-3、GPT-4 与全球千亿美元 AI 军备竞赛
✅ 跨越 7 个数量级的平滑幂律 ✅ 小模型提前预知千亿级成果 🚀 硅谷巨头暴力美学的核心理论
💡

5岁核心顿悟:为什么 Kaplan 这篇论文改变了整个人类历史?

像“人类在起飞前先发现了空气动力学公式”一样 ✈️📈
• 以前造大模型就像在黑暗中扔石子,不知道扔多大力能砸多远;
Kaplan(前理论物理学家,后为 Anthropic 联合创始人)告诉硅谷:别瞎猜了!只要你把模型参数扩大 10 倍、训练数据喂多 10 倍、GPU 算力堆上 100 倍,模型的犯错率(Loss)就一定会严格按照幂律公式精确下降,绝无瓶颈
OpenAI 彻底信了:正是因为有了这条公式的庇佑,Sam Altman 才敢毅然向微软要来上百亿美元去押注 GPT-3 和 GPT-4,掀起全球生成式 AI 狂潮!

Kaplan 尺度定律的三大核心结论

参数、数据与架构无关性:物理学式的优雅简洁

📏

1. 跨越数量级的优美幂律 (Power Law)

性能提升与网络架构的微调(比如做更深还是更宽、注意力头数多少)关系极小!决定智商高低的只有三大要素:参数量 $N$、数据量 $D$ 和总算力 $C$

🧠

2. 优先扩大参数(“大模型浅训练”)

Kaplan 在 2020 年指出:算力增加时,扩大模型参数规模的收益远高于增加数据量(推荐将 73% 的算力增长用来扩模型,仅 27% 用来扩数据)。这直接启发了 1750 亿参数的 GPT-3。

🔮

3. 小模型精准预测超级大模型

只需在 10M、100M、1B 的极小模型上跑几台 GPU 跑出点位,在双对数坐标轴上一连线,就能在几十亿美元开销之前,提前 6 个月预知 GPT-4 的最终损失率

📐 尺度定律的核心公式图解

测试集交叉熵损失(Cross-Entropy Loss)$L$ 与各要素之间的数学关系:

针对参数量 $N$
$$L(N) \approx \left(\frac{N_c}{N}\right)^{\alpha_N}$$

$\alpha_N \approx 0.076$。参数每放大,模型的潜在表征容量指数级上升。

针对数据量 $D$ (Tokens)
$$L(D) \approx \left(\frac{D_c}{D}\right)^{\alpha_D}$$

$\alpha_D \approx 0.095$。只要不重复过拟合,见识的数据越多,泛化损失越低。

针对总算力 $C$ (FLOPs)
$$L(C) \approx \left(\frac{C_c}{C}\right)^{\alpha_C}$$

$\alpha_C \approx 0.050$。算力是硬通货,每一万张 H100 燃烧的都是不可逆的确定性进步。

💡 补充知识:后来的 Chinchilla 定律修正了什么?
2022 年 DeepMind 发现 Kaplan 定律由于训练提前停止等原因,低估了数据的重要性。DeepMind 的 Chinchilla 定律 证明:参数量和训练 Token 应该等比例(1:1)增加!这直接启发了后来用 15 万亿 Token 充分训练较小模型的 LLaMA 系列!

🎮 交互模拟器:推演大模型在不同算力下的损失与智商

滑动或选择不同的训练算力级别,感受幂律直线在真实物理世界中的推演威力: