🧠 图解记忆: 先看硬件与模型能否运行,再看工作负载,最后用真实基准和运维能力定框架。
💡 答案要点
选型决策树:
追求极致性能?
├── 是 → TensorRT-LLM
↓ 否
多轮对话场景?
├── 是 → SGLang
↓ 否
需要结构化输出?
├── 是 → SGLang
↓ 否
快速验证/通用场景
→ vLLM场景选型建议:
| 场景 | 推荐框架 | 原因 |
|---|---|---|
| 日常推理/RAG API | vLLM | 易用,兼容性好,快速部署 |
| 多轮对话/客服 | SGLang | 前缀缓存,省显存,多轮效率高 |
| 结构化输出(JSON/Tool Call) | SGLang | 原生正则约束,成功率高 |
| 极致吞吐/大并发 | TensorRT-LLM | 性能最强 |
| 非NVIDIA硬件 | vLLM | AMD ROCm支持好 |
面试话术:
"我的选型方法:先vLLM快速验证,再根据瓶颈优化。多轮对话选SGLang,生产环境追求性能选TensorRT-LLM。实际上很多公司是组合使用——vLLM做POC,TensorRT-LLM做生产。"
