
🧠 记忆锚点:DDP 复制模型并行数据;FSDP/ZeRO 分片训练状态,越省显存越依赖通信与工程能力。
💡 答案要点
- DDP 每张卡保存完整模型和优化器状态,主要并行数据;
- FSDP/ZeRO 将参数、梯度和优化器状态按不同阶段分片,降低单卡显存;
- 分片越彻底,通信、预取、保存 checkpoint 和故障恢复越复杂。
选型先用显存账本估算参数、梯度、优化器状态、激活和临时 buffer,再结合网络带宽、模型规模和节点数压测。不要只背“ZeRO-3 最省显存”。
📚 参考:PyTorch FSDP 论文(Fully Sharded Data Parallel) · Hugging Face:DeepSpeed ZeRO 集成指南