Skip to content
🔗 分享本题
查看我的学习进度 →

Scaling Law 动漫知识图:参数、训练数据和算力增加时验证损失呈可预测下降但收益递减,固定算力下需要联合优化参数规模与训练 Token 数

🧠 图解记忆:Scaling Law 预测趋势,固定算力要平衡参数与数据;点击图片可查看原图。

Scaling Law = 模型性能(Loss)与参数量、数据量、计算量之间存在可预测的幂律关系。

核心公式(OpenAI 2020)

Loss ≈ a·N^(-α) + b·D^(-β) + c

N = 参数量    D = 训练数据量    a,b,c,α,β = 常数
  • 参数翻倍 → Loss 稳定下降(收益递减)
  • 数据翻倍 → Loss 稳定下降
  • 结论:模型越大、数据越多,效果越好,且可预测

Chinchilla 法则(DeepMind 2022)修正了什么?

核心结论:参数和数据要按约 1:20 的比例配比(训练 Token 数 ≈ 参数 × 20)

项目之前做法Chinchilla 修正后
参数 70B只喂 300B tokens(欠喂)应喂 1.4T tokens(1.4万亿)
计算预算固定盲目堆参数参数和数据按比例分配

类比:堆参数量相当于"天才只读小学课本",参数和数据要匹配才最优。

Scaling Law 的意义(面试重点)

  1. 可预测性:用小模型实验(1B)可以推算大模型(70B)的表现,避免盲目烧钱
  2. 指导训练预算分配:固定算力下,算最优参数/数据配比
  3. 能力涌现的前提:规模是涌现能力的基础(呼应"涌现能力"题)
  4. 2026 新趋势:从"训练时 Scaling"扩展到"测试时 Scaling"(Test-Time Compute,见 Q19)——推理阶段多花算力也能换效果

面试话术:

"Scaling Law 说模型效果和参数量、数据量、算力呈幂律关系,可以预测。Chinchilla 修正了'只堆参数'的误区,提出参数和数据约 1:20 配比——70B 模型要喂 1.4T tokens 才最优。工程上它的价值是可预测性:先在 1B 小模型上做实验,再推算 70B 的表现,节省大量试错成本。2026 年 Scaling 已经从训练侧延伸到推理侧,就是 Test-Time Compute。"