面试优先顺序(通用 AI 应用开发岗位):Q1、Q3、Q4、Q5、Q11、Q12、Q13、Q15、Q17。其余题目用于进阶或特定岗位拓展;实际频率会随岗位和面试轮次变化,产品版本资讯不应当作通用必考题。
难度: ⭐⭐⭐⭐ 更新: 2026-08-21 考点: Transformer、Self-Attention、BERT、GPT、位置编码
题目目录(按原文档学习顺序,⭐ = 面试高频优先题)
BERT与GPT
Transformer基础
优化技巧
注意力机制
- ⭐ Q3 · Self-Attention(自注意力)是如何计算的?
- ⭐ Q4 · Multi-Head Attention(多头注意力)是什么?为什么要用多头?
- ⭐ Q5 · 位置编码(Positional Encoding)是什么?为什么需要它?
进阶架构:Transformer + SSM 混合模型(Mamba)
- Q10 · 什么是 SSM(状态空间模型)?它与 Transformer 混合时解决什么问题?
- ⭐ Q11 · MHA、MQA 和 GQA 有什么区别?为什么推理系统常用 GQA?
- ⭐ Q12 · Transformer 的 FFN 做什么?SwiGLU 为什么常见?
- ⭐ Q13 · Pre-Norm、Post-Norm 和 RMSNorm 有什么关系?
- Q14 · RoPE 长度外推为什么会退化?常见扩展方法如何验证?
- ⭐ Q15 · FlashAttention 为什么能加速 Attention 计算?核心优化策略是什么?
- Q16 · MoE(Mixture of Experts)的原理、收益和工程代价是什么?
- ⭐ Q17 · KV Cache 显存管理难题?PagedAttention 如何解决?
- Q18 · SwiGLU、GLU 和标准 FFN(ReLU/GELU)在 FFN 中的门控机制有什么不同?
- Q19 · MLA(Multi-Latent Attention)是什么?为什么 DeepSeek v3 用它替代 GQA?
- Q20 · Scaling Laws 是什么?Chinchilla 的 "compute-optimal" 意味着什么?
- Q21 · Tokenization 方法有哪些?BPE、WordPiece、SentencePiece 有什么区别?
- Q22 · ALiBi(Attention with Linear Biases)的工作原理?为什么它能零样本外推?
- Q23 · Sliding Window Attention(滑动窗口注意力)是什么?它解决了什么问题?
- Q24 · 为什么 2026 年的主流 LLM 全部转向 Causal Decoder-Only 架构?
- Q25 · LayerNorm 和 RMSNorm 有什么区别?为什么现代 LLM 普遍改用 RMSNorm?
- Q26 · Transformer 的训练过程中 Loss Curve 会出现哪些典型阶段?如何诊断?