🧠 图解记忆:算力和模型一起放大,损失按幂律下降;别只堆参数不喂数据。
💡 答案要点
Scaling Laws = 模型能力随规模变化的经验规律
Loss(N, D, C) ~ a + b * N^(-alpha) + c * D^(-beta)
其中:N=参数量, D=训练 token 数, C=FLOPs~6ND*L 关键结论:alpha > beta → 增加数据比增加参数更有效降低 Loss
Chinchilla 的核心发现(面试必考): 传统做法:给定算力→选大模型→有限数据训练(欠训练) Chinchilla:给定算力→适中N+足够大的D,最优配比~20个token/参数 Chinchilla 70B 训练 1.4T tokens(20:1),超过 PaLM 62B
| 偏离方向 | 表现 | 解释 |
|---|---|---|
| N太大D太小 | Loss平台期明显 | 有容量但没见过足够模式 |
| N太小D太大 | 后期Loss几乎不降 | 已达表示能力天花板 |
| 偏离 < 2x optimal | 影响可控 | 数据质量优先 |
| 偏离 > 5x optimal | 显著低于预期 | 必须重新分配 |
注意事项:MoE需修正(active vs total params)、inference-aware scaling考虑延迟后最优偏小、高质量文本接近耗尽时需合成数据。
面试话术:
"Scaling Laws 告诉我们损失呈幂律下降。Chinchilla 量化了'欠训练'现象——之前的团队给太多参数却喂太少数据。对固定算力预算,最优方案是让参数量和token数同步增长,约20:1比例。我们应该造小一点但吃饱的模型。"