Skip to content
🔗 分享本题
查看我的学习进度 →

推理框架专题第24题核心机制与工程取舍图解

🧠 图解记忆: 框架选型是硬件、模型、负载、SLO 和运维约束的交集,不是一张排行榜。

💡 答案要点

完整选型决策树:

第一步:你在什么环境?
    ├── 个人电脑/Mac(无 GPU)
    │   └── ✅ Ollama 或 llama.cpp
    │       (零配置,快速上手)

    ├── Linux 服务器(GPU)


第二步:你的场景是什么?
    ├── 高并发生产服务(>100 QPS)
    │   └── ✅ vLLM
    │       (极致吞吐量,支持分布式)

    ├── 需要多模型(LLM + Embedding + Rerank)
    │   └── ✅ XInference
    │       (统一平台,一个 API 管所有)

    ├── HuggingFace 模型,快速部署
    │   └── ✅ TGI
    │       (官方支持,文档齐全)

    ├── 本地开发/快速验证
    │   └── ✅ Ollama
    │       (5分钟跑起来)

    └── 极致性能 + NVIDIA 生产环境
        └── ✅ TensorRT-LLM
            (H100 上 10x throughput)

实际场景选型案例:

场景推荐框架配置效果
Mac 开发Ollamaollama run qwen2.5:14b5分钟跑起来
Linux 生产(1000 QPS)vLLM8×A100 + Tensor并行5000 tok/s
多模型 RAG 平台XInferenceLLM + bge + reranker一个平台管所有
企业内网(无外网)llama.cppQ4 量化 + CPU无 GPU 也能跑
极致性能TensorRT-LLMH100 集群10x throughput

面试话术:

"推理框架选型其实就一句话:先想清楚你在什么环境、要求什么性能。我的决策树是:Mac 开发用 Ollama,生产高并发用 vLLM,多模型平台用 XInference,极致性能用 TensorRT-LLM。实际上很多公司是组合使用——开发用 Ollama 快速验证,生产用 vLLM 部署模型。框架不是非此即彼,而是各有所长。"

📚 参考:vLLM 官方文档 · SGLang 官方文档