Skip to content
🔗 分享本题
查看我的学习进度 →

🧠 图解记忆:算力和模型一起放大,损失按幂律下降;别只堆参数不喂数据。

💡 答案要点

Scaling Laws = 模型能力随规模变化的经验规律

Loss(N, D, C) ~ a + b * N^(-alpha) + c * D^(-beta)

其中:N=参数量, D=训练 token 数, C=FLOPs~6ND*L 关键结论:alpha > beta → 增加数据比增加参数更有效降低 Loss

Chinchilla 的核心发现(面试必考): 传统做法:给定算力→选大模型→有限数据训练(欠训练) Chinchilla:给定算力→适中N+足够大的D,最优配比~20个token/参数 Chinchilla 70B 训练 1.4T tokens(20:1),超过 PaLM 62B

偏离方向表现解释
N太大D太小Loss平台期明显有容量但没见过足够模式
N太小D太大后期Loss几乎不降已达表示能力天花板
偏离 < 2x optimal影响可控数据质量优先
偏离 > 5x optimal显著低于预期必须重新分配

注意事项:MoE需修正(active vs total params)、inference-aware scaling考虑延迟后最优偏小、高质量文本接近耗尽时需合成数据。

面试话术:

"Scaling Laws 告诉我们损失呈幂律下降。Chinchilla 量化了'欠训练'现象——之前的团队给太多参数却喂太少数据。对固定算力预算,最优方案是让参数量和token数同步增长,约20:1比例。我们应该造小一点但吃饱的模型。"