🧠 图解记忆: 框架选型是硬件、模型、负载、SLO 和运维约束的交集,不是一张排行榜。
💡 答案要点
完整选型决策树:
第一步:你在什么环境?
├── 个人电脑/Mac(无 GPU)
│ └── ✅ Ollama 或 llama.cpp
│ (零配置,快速上手)
│
├── Linux 服务器(GPU)
│
↓
第二步:你的场景是什么?
├── 高并发生产服务(>100 QPS)
│ └── ✅ vLLM
│ (极致吞吐量,支持分布式)
│
├── 需要多模型(LLM + Embedding + Rerank)
│ └── ✅ XInference
│ (统一平台,一个 API 管所有)
│
├── HuggingFace 模型,快速部署
│ └── ✅ TGI
│ (官方支持,文档齐全)
│
├── 本地开发/快速验证
│ └── ✅ Ollama
│ (5分钟跑起来)
│
└── 极致性能 + NVIDIA 生产环境
└── ✅ TensorRT-LLM
(H100 上 10x throughput)实际场景选型案例:
| 场景 | 推荐框架 | 配置 | 效果 |
|---|---|---|---|
| Mac 开发 | Ollama | ollama run qwen2.5:14b | 5分钟跑起来 |
| Linux 生产(1000 QPS) | vLLM | 8×A100 + Tensor并行 | 5000 tok/s |
| 多模型 RAG 平台 | XInference | LLM + bge + reranker | 一个平台管所有 |
| 企业内网(无外网) | llama.cpp | Q4 量化 + CPU | 无 GPU 也能跑 |
| 极致性能 | TensorRT-LLM | H100 集群 | 10x throughput |
面试话术:
"推理框架选型其实就一句话:先想清楚你在什么环境、要求什么性能。我的决策树是:Mac 开发用 Ollama,生产高并发用 vLLM,多模型平台用 XInference,极致性能用 TensorRT-LLM。实际上很多公司是组合使用——开发用 Ollama 快速验证,生产用 vLLM 部署模型。框架不是非此即彼,而是各有所长。"
📚 参考:vLLM 官方文档 · SGLang 官方文档
