Skip to content
🔗 分享本题
查看我的学习进度 →
概念一句话解释
Transformer基于自注意力的序列模型,可并行训练
Self-Attention每个token关注所有其他token
Multi-Head多个注意力头捕捉不同关系
Positional Encodingsin/cos函数注入位置信息

注意力机制

公式/概念说明
Attention(Q,K,V)softmax(QK^T/√d_k)V
缩放因子√d_k,避免点积过大使 Softmax 饱和
Causal Mask上三角mask,生成时只看之前
Cross-AttentionQ来自Decoder,K/V来自Encoder

BERT vs GPT

维度BERTGPT
架构Encoder onlyDecoder only
注意力双向单向(masked)
训练MLM + NSP自回归LM
任务理解(分类/NER)生成(对话/摘要)

优化技巧

技巧效果
Warmup稳定训练,先升后降学习率
Label Smoothing缓解过度自信;是否有效需按任务验证
Gradient Clipping限制梯度范数;阈值是超参数
Mixed Precision降低显存/带宽并利用低精度算力;收益依硬件与算子而定
Gradient Accumulation模拟大batch,不增显存