🧠 图解记忆:Scaling Law 预测趋势,固定算力要平衡参数与数据;点击图片可查看原图。
Scaling Law = 模型性能(Loss)与参数量、数据量、计算量之间存在可预测的幂律关系。
核心公式(OpenAI 2020)
Loss ≈ a·N^(-α) + b·D^(-β) + c
N = 参数量 D = 训练数据量 a,b,c,α,β = 常数- 参数翻倍 → Loss 稳定下降(收益递减)
- 数据翻倍 → Loss 稳定下降
- 结论:模型越大、数据越多,效果越好,且可预测
Chinchilla 法则(DeepMind 2022)修正了什么?
核心结论:参数和数据要按约 1:20 的比例配比(训练 Token 数 ≈ 参数 × 20)
| 项目 | 之前做法 | Chinchilla 修正后 |
|---|---|---|
| 参数 70B | 只喂 300B tokens(欠喂) | 应喂 1.4T tokens(1.4万亿) |
| 计算预算固定 | 盲目堆参数 | 参数和数据按比例分配 |
类比:堆参数量相当于"天才只读小学课本",参数和数据要匹配才最优。
Scaling Law 的意义(面试重点)
- 可预测性:用小模型实验(1B)可以推算大模型(70B)的表现,避免盲目烧钱
- 指导训练预算分配:固定算力下,算最优参数/数据配比
- 能力涌现的前提:规模是涌现能力的基础(呼应"涌现能力"题)
- 2026 新趋势:从"训练时 Scaling"扩展到"测试时 Scaling"(Test-Time Compute,见 Q19)——推理阶段多花算力也能换效果
面试话术:
"Scaling Law 说模型效果和参数量、数据量、算力呈幂律关系,可以预测。Chinchilla 修正了'只堆参数'的误区,提出参数和数据约 1:20 配比——70B 模型要喂 1.4T tokens 才最优。工程上它的价值是可预测性:先在 1B 小模型上做实验,再推算 70B 的表现,节省大量试错成本。2026 年 Scaling 已经从训练侧延伸到推理侧,就是 Test-Time Compute。"
