| 概念 | 一句话解释 |
|---|---|
| 微调 | 在预训练模型基础上,用特定任务数据继续训练 |
| 全量微调 | 更新所有参数,效果最好但成本高 |
| PEFT | 只更新 1% 参数,效果接近全量 |
| SFT | 监督微调,用标注数据训练 |
| 数据准备 | 6步:需求→收集→清洗→标注→格式化→验证,质量>数量 |
LoRA核心概念
| 概念 | 一句话解释 |
|---|---|
| LoRA | 用低秩矩阵近似权重更新,参数少 |
| r(秩) | 低秩维度,越大效果越好但参数越多 |
| α(缩放) | 控制 LoRA 影响强度,通常 α=2r |
| QLoRA | 在 4bit 量化模型上应用 LoRA |
对齐核心概念
| 概念 | 一句话解释 |
|---|---|
| RLHF | 基于人类反馈的强化学习,三阶段 |
| RM | 奖励模型,评估答案质量 |
| PPO | 强化学习算法,优化策略 |
| DPO | 直接偏好优化,简化版 RLHF |
训练优化
| 方法 | 显存节省 | 速度影响 |
|---|---|---|
| 梯度累积 | 50-80% | 无 |
| FP16 | 50% | +20% |
| 梯度检查点 | 30-40% | -20% |
| LoRA | 80-90% | 无 |
| QLoRA | 90-95% | -15% |