面试优先顺序(通用 AI 应用开发岗位):Q1、Q2、Q3、Q5、Q9、Q10、Q14、Q16、Q19、Q20、Q24、Q27、Q28。其余题目用于进阶或特定岗位拓展;实际频率会随岗位和面试轮次变化,产品版本资讯不应当作通用必考题。
难度: ⭐⭐⭐⭐⭐ 更新: 2026-04-08 考点: vLLM、SGLang、TensorRT-LLM、PagedAttention、RadixAttention、推理优化
题目目录(按原文档学习顺序,⭐ = 面试高频优先题)
三大推理框架概述
- ⭐ Q1 · vLLM、SGLang、TensorRT-LLM 三大推理框架各自定位是什么?
- ⭐ Q2 · 什么是 PagedAttention?它解决了什么问题?
- ⭐ Q3 · 什么是 RadixAttention?和 PagedAttention 有什么区别?
性能基准对比
推理基础设施安全
推理引擎选型更新
推理框架基准测试方法
- ⭐ Q19 · 为什么不能直接背诵不同推理框架的吞吐和延迟数字?
- ⭐ Q20 · 如何设计可复现的 LLM 推理框架 Benchmark?
- Q21 · XInference 和 vLLM 有什么区别?什么场景选 XInference?
- Q22 · HuggingFace TGI 和 vLLM 有什么关系?各自优劣是什么?
- Q23 · llama.cpp 是什么?它有哪些独特优势?
- ⭐ Q24 · 如何根据场景选择推理框架?完整的选型决策树是什么?
更多推理框架与硬件选型
- Q25 · 除了 vLLM、SGLang 和 TensorRT-LLM,还有哪些推理框架?如何按硬件选型?
- Q26 · DFlash 的块扩散解码思路是什么?适用边界有哪些?
- ⭐ Q27 · 什么是 EAGLE 投机采样?它与传统 Speculative Decoding 有什么区别?
核心技术对比
选型与落地实践
高频面试题
- Q11 · PagedAttention 为什么能大幅提升吞吐量?
- Q12 · SGLang 的 RadixAttention 在什么场景下优势最大?
- Q13 · TensorRT-LLM 为什么能实现极致性能?它的局限是什么?
- ⭐ Q14 · 什么是 Speculative Decoding?
- Q15 · vLLM 和 SGLang 可以一起用吗?
- ⭐ Q16 · 什么是 PD 分离(Prefill-Decode 分离)?什么时候值得使用?
- Q17 · DeepSeek-V3/R1 有哪些与推理效率相关的架构设计?