| 概念 | 一句话解释 |
|---|---|
| Transformer | 基于自注意力的序列模型,可并行训练 |
| Self-Attention | 每个token关注所有其他token |
| Multi-Head | 多个注意力头捕捉不同关系 |
| Positional Encoding | sin/cos函数注入位置信息 |
注意力机制
| 公式/概念 | 说明 |
|---|---|
| Attention(Q,K,V) | softmax(QK^T/√d_k)V |
| 缩放因子 | √d_k,避免点积过大使 Softmax 饱和 |
| Causal Mask | 上三角mask,生成时只看之前 |
| Cross-Attention | Q来自Decoder,K/V来自Encoder |
BERT vs GPT
| 维度 | BERT | GPT |
|---|---|---|
| 架构 | Encoder only | Decoder only |
| 注意力 | 双向 | 单向(masked) |
| 训练 | MLM + NSP | 自回归LM |
| 任务 | 理解(分类/NER) | 生成(对话/摘要) |
优化技巧
| 技巧 | 效果 |
|---|---|
| Warmup | 稳定训练,先升后降学习率 |
| Label Smoothing | 缓解过度自信;是否有效需按任务验证 |
| Gradient Clipping | 限制梯度范数;阈值是超参数 |
| Mixed Precision | 降低显存/带宽并利用低精度算力;收益依硬件与算子而定 |
| Gradient Accumulation | 模拟大batch,不增显存 |