面试优先顺序(通用 AI 应用开发岗位):1、3、4、5、7、9、10、20、21、23、27、30、34、36。其余题目用于进阶或特定岗位拓展;实际频率会随岗位和面试轮次变化,产品版本资讯不应当作通用必考题。
Q: LLM 的 Token 是什么?中文和英文有什么区别?
💡 参考答案
- Token 是 LLM 处理文本的基本单位
- 英文:1 token ≈ 4 个字符 ≈ 0.75 个单词
- 中文:1 个汉字 ≈ 1-2 个 tokens
- 影响:计费、上下文限制、生成长度都按 token 算
| 序号 | 模块 | 新增内容 | 高频度 | 题数 |
|---|---|---|---|---|
| 🆕 | 🤖 合成数据 | Q46 合成数据三法(Self-Instruct/教师蒸馏/偏好对):模型自主生产训练数据,工业界70:30混合策略防坍缩 | 🔥🔥🔥🔥 | +1 |
| 🆕 | 🔧 Function Calling | Q47 函数调用五步工作流(schema声明→模型判断→JSON参数→应用执行→结果回传),工程陷阱(类型漂移/无限循环)全覆盖 | 🔥🔥🔥🔥🔥 | +1 |
| 🆕 | 🏗️ Encoder-Decoder | Q48 编码器解码器架构(T5/BART):Encoder理解(双向)+Decoder产出(单向)+Cross-Attention;翻译摘要仍不可替代 | 🔥🔥🔥🔥 | +1 |
| 🆕 | 💡 FlashAttention | Q41 FlashAttention I/O感知设计:SRAM分块+在线Softmax递推+重计算;显存O(n²)→O(n),训练提速1.5~2×,FA-2再提25% | 🔥🔥🔥🔥🔥 | +1 |
| 🆕 | ⚡ GQA/MQA | Q42 MHA→MQA→GQA演进:KV头共享策略权衡,Llama3 8GQA省16倍显存质量无损,支持up-training | 🔥🔥🔥🔥🔥 | +1 |
| 🆕 | 🔄 Continuous Batching | Q43 迭代级动态调度:请求完成立即释放slot,配合PagedAttention吞吐提升20×+,chunked prefill防长prompt阻塞 | 🔥🔥🔥🔥🔥 | +1 |
| 🆕 | 📍 ALiBi vs RoPE | Q44 ALiBi线性偏置外推强、RoPE旋转编码精度高,YaRN混合架构2025趋势,FlashInfer支持ALiBi kernel | 🔥🔥🔥🔥 | +1 |
| 🆕 | 🎛️ Logit Bias & Top-A | Q45 生成控制工具链:Logit Bias指数级修改raw logits,Top-A自适应绝对阈值,温度/候选集/惩罚/Bias组合拳 | 🔥🔥🔥🔥 | +1 |
本次更新:+3 道题(Q46、Q47、Q48)
版本: v3.131 | 更新: 2026-08-25
题目目录(按原文档学习顺序,⭐ = 面试高频优先题)
目录
- ⭐ Q01 · Token 是什么?
- Q02 · Temperature、Top-P、Top-K
- ⭐ Q03 · Context Window(上下文窗口)
- ⭐ Q04 · LLM 和传统机器学习模型有什么区别?为什么是“大”语言模型?
- ⭐ Q05 · 幻觉(Hallucination)
面试题
- Q06 · 什么是涌现能力(Emergent Abilities)?“突然出现”一定是真的吗?
- ⭐ Q07 · LLM 为什么是概率模型?为什么同样的输入输出会不一样?
- Q08 · LLM的幻觉(Hallucination)与偏见(Bias)
- ⭐ Q09 · 如何评估LLM的输出质量?
- ⭐ Q10 · Tokenization分词算法:BPE vs SentencePiece
- Q11 · 长文本处理:超出Context Window怎么办?
- Q12 · 如何给 LLM 选型?质量/速度/成本怎么权衡?(方法论)
- Q13 · 什么是推理模型(Reasoning Model)?o3/R1/QwQ 和普通模型有什么区别?
- Q14 · 什么是 Test-Time Compute(测试时算力)?Thinking Budget 如何控制 AI 的思考量?
- Q15 · 什么是 Logits?LLM 是如何一步步生成下一个 Token 的?
- Q16 · 解码策略对比:贪心解码 vs Beam Search vs 采样
- Q17 · 为什么 Temperature=0 时输出依然不完全确定?
- Q18 · 什么是重复惩罚(repetition_penalty)?如何防止复读机?
- Q19 · 什么是停止符(EOS / Stop Token)?生成是如何终止的?
- ⭐ Q20 · 为什么主流 LLM 都是 Decoder-only 架构?
- ⭐ Q21 · Embedding(嵌入向量)是什么?和 Token 有什么关系?
- Q22 · 什么是 In-Context Learning(上下文学习)?Zero-shot / Few-shot 有什么区别?
- ⭐ Q23 · LLM 是怎么训练出来的?预训练 → SFT → 对齐(RLHF/DPO)三阶段流程?
- Q24 · 什么是 Scaling Law(规模定律)?Chinchilla 法则修正了什么?
- Q25 · KV Cache 是什么?为什么能大幅加速 LLM 推理?(基础概念版)
- Q26 · RLHF 和 DPO 有什么区别?(入门对比版)
- ⭐ Q27 · 7B 模型需要多少显存?参数量如何换算显存?(高频估算题)
- Q28 · 什么是 Chat Template(对话模板)?为什么用错模板效果会暴跌?
- Q29 · 什么是 MoE(混合专家模型)?为什么 DeepSeek V3 / Qwen3 都用它?(高频)
- ⭐ Q30 · 为什么说 LLM API 是无状态的?多轮对话的"记忆"到底存在哪?(应用开发第一性原理)
- Q31 · 什么是 Prompt Caching(提示词缓存)?怎样评估它能否真正降本?(API 层高频)
- Q32 · 大模型量化是什么?INT8 / INT4 / AWQ / GPTQ 怎么选?(基础概念版)
- Q33 · 为什么 LLM 数学能力差?怎么缓解?(高频追问)
- ⭐ Q34 · Transformer 中的 Attention 机制是什么?为什么它是 LLM 的核心?(必考)
- Q35 · 为什么 Transformer 需要 Position Encoding?RoPE 和绝对位置编码有什么区别?(高频)
- ⭐ Q36 · LLM 预训练用什么损失函数?Cross-Entropy Loss 和 Perplexity 有什么关系?(常见追问)
- Q37 · LayerNorm 和 RMSNorm 有什么区别?为什么现在的 LLM 大多用 RMSNorm?(高频)
- Q38 · Decoder-only 模型中的因果掩码(Causal Mask)是怎么工作的?为什么必须有它?(高频)
- Q39 · 预训练数据去重(Deduplication)有什么重要性?MinHash 和 SimHash 怎么做的?(进阶高频)
- Q40 · 什么是 Catastrophic Forgetting(灾难性遗忘)?微调时怎么缓解?(实战必考)
- Q41 · FlashAttention 是什么?为什么它比标准 Attention 快很多?(高频)
- Q42 · MHA、MQA、GQA 有什么本质区别?为什么行业转向了 GQA?(高频)
- Q43 · Continuous Batching(连续批处理)是怎么工作的?为什么吞吐量能大幅提升?(实战必考)
- Q44 · ALiBi 位置编码是什么?和 RoPE 有什么区别、各适用于什么场景?(进阶高频)
- Q45 · Logit Bias 和采样控制:如何精准控制 LLM 的输出?(实战必考)
- Q46 · 什么是合成数据(Synthetic Data)?为什么现在大模型训练越来越依赖它?(高频)
- Q47 · 什么是 Function Calling(函数调用)?它是如何工作的?为什么重要?(应用开发第一性原理)
- Q48 · 为什么 Transformer 不只是 Decoder-only?Encoder-Decoder(T5/BART)架构有什么独特价值?(进阶必考)
- Q49 · 什么是思维链推理(Chain-of-Thought, CoT)?为什么它能大幅提升模型表现?(面试必考)
- Q50 · 什么是PEFT(参数高效微调)?LoRA/QLoRA/P-Tuning有什么区别?(必考)
- Q51 · 少样本学习(Few-Shot Learning)的最佳实践是什么?什么时候用ICL替代微调?(实战高频)
- Q52 · 什么是知识截止期(Knowledge Cutoff)?模型遇到"不知道"的事该怎么办?(必考题)
- Q53 · 幻觉有哪些不同类型?如何在工程中系统性地检测和处理?(进阶必考)
- Q54 · Perplexity(困惑度)是什么?如何用它评估语言模型的好坏?(常见补充)