🧠 图解记忆:Pre/Post 问放哪里,Layer/RMS 问怎么算;点击图片可查看原图。
💡 答案要点
Pre/Post 描述归一化在残差分支前还是后;LayerNorm/RMSNorm 描述归一化算子本身,二者不是同一维度。Pre-Norm 通常更容易训练深层网络,因为残差主路径更直接;Post-Norm 是原始 Transformer 形式,但深层训练往往更敏感。RMSNorm 不减均值,只按均方根缩放,计算更简单。
面试中应画出残差公式,并说明训练稳定性结论还受初始化、残差缩放和优化器影响。
📚 参考:On Layer Normalization in the Transformer Architecture(Pre/Post-Norm 分析) · LLaMA(RMSNorm 用例)
