面试优先顺序(通用 AI 应用开发岗位):Q2、Q3、Q5、Q6、Q7、Q8、Q9、Q10、Q11、Q13、Q16。其余题目用于进阶或特定岗位拓展;实际频率会随岗位和面试轮次变化,产品版本资讯不应当作通用必考题。
难度: ⭐⭐⭐⭐⭐ 更新: 2026-03-05 考点: KV Cache、量化、推理加速、部署优化
题目目录(按原文档学习顺序,⭐ = 面试高频优先题)
KV Cache优化
PD 分离架构与 KV Cache 跨节点传输
- Q15 · vLLM v1的PD分离架构是什么?Mooncake + LMCache如何实现KV Cache跨节点传输?生产环境如何部署?
- ⭐ Q16 · 什么是 Continuous Batching 和 Chunked Prefill?2026 年为什么它们是推理引擎的核心优化?
推理加速
- ⭐ Q8 · FlashAttention 是什么?为什么能加速?
- ⭐ Q9 · 批处理(Batching)如何提升推理吞吐量?Continuous Batching 是什么?
- ⭐ Q10 · Speculative Decoding(推测解码)是什么?
- ⭐ Q11 · 推理优化应该关注哪些指标?TTFT、TPOT、ITL 和吞吐如何权衡?
- Q12 · KV Cache 量化与误差补偿的核心思路是什么?
- ⭐ Q13 · 什么是 Prefix Caching 和 RadixAttention?为什么长上下文场景必须用它?
- Q14 · 什么是 Attention Matching?MIT 如何实现 KV Cache 50倍无损压缩?2026年 KV Cache 优化技术有哪些新方向?