Skip to content
🔗 分享本题
查看我的学习进度 →
概念一句话解释
微调在预训练模型基础上,用特定任务数据继续训练
全量微调更新所有参数,效果最好但成本高
PEFT只更新 1% 参数,效果接近全量
SFT监督微调,用标注数据训练
数据准备6步:需求→收集→清洗→标注→格式化→验证,质量>数量

LoRA核心概念

概念一句话解释
LoRA用低秩矩阵近似权重更新,参数少
r(秩)低秩维度,越大效果越好但参数越多
α(缩放)控制 LoRA 影响强度,通常 α=2r
QLoRA在 4bit 量化模型上应用 LoRA

对齐核心概念

概念一句话解释
RLHF基于人类反馈的强化学习,三阶段
RM奖励模型,评估答案质量
PPO强化学习算法,优化策略
DPO直接偏好优化,简化版 RLHF

训练优化

方法显存节省速度影响
梯度累积50-80%
FP1650%+20%
梯度检查点30-40%-20%
LoRA80-90%
QLoRA90-95%-15%