面试优先顺序(通用 AI 应用开发岗位):Q1、Q3、Q4、Q5、Q6、Q7、Q8、Q10、Q13、Q18、Q19、Q20。其余题目用于进阶或特定岗位拓展;实际频率会随岗位和面试轮次变化,产品版本资讯不应当作通用必考题。
难度: ⭐⭐⭐⭐ 更新: 2026-04-15 考点: LoRA、RLHF、DPO、微调策略、训练优化、TRL v1.0
| 日期 | 更新内容 |
|---|---|
| 2026-05-07 | 新增 Q14 DAPO/GSPO(GRPO进化版)、Q15 信用分配问题 |
| 2026-04-15 | 新增 Q13 TRL v1.0(75+后训练方法、chaos-adaptive设计哲学) |
| 2026-03-05 | 新增大模型微调与训练面试题 11 道 |
题目目录(按原文档学习顺序,⭐ = 面试高频优先题)
LoRA与PEFT
后训练与分布式训练进阶
- Q14 · TRL v1.0 是什么?为什么代表了后训练库的工程化成熟?
- Q15 · DAPO 和 GSPO 是什么?它们和 GRPO 有什么区别?
- Q16 · 什么是信用分配问题(Credit Assignment Problem)?token级别和seq级别的奖励有何不同?
- Q17 · 训练数据 Packing 是什么?为什么要正确处理 attention mask 和 loss mask?
- ⭐ Q18 · 学习率、Warmup、梯度裁剪和有效 Batch Size 如何联动?
- ⭐ Q19 · DDP、FSDP 和 ZeRO 分别解决什么问题?
- ⭐ Q20 · 如何判断微调过拟合、数据泄漏或只是评测噪声?
对齐技术:RLHF与DPO
微调基础概念
训练优化
- ⭐ Q10 · 训练时遇到 OOM(显存不足)怎么办?
- Q11 · 如何防止微调时的灾难性遗忘(Catastrophic Forgetting)?
- Q12 · PEFT方法对比:LoRA vs QLoRA vs Adapter vs Prefix-Tuning
- ⭐ Q13 · 微调数据如何准备?数据质量如何保证?