Skip to content
🔗 分享本题
查看我的学习进度 →

推理框架专题第20题核心机制与工程取舍图解

🧠 图解记忆: 可复现基准要固定条件、公开负载、区分场景、报告尾延迟,并交付完整复现包。

💡 答案要点

1. 固定不可变条件

记录模型与 revision、dtype/量化方案、GPU 型号与数量、驱动/CUDA、框架 commit、容器镜像、并行策略和完整启动参数。

2. 使用代表性流量

至少覆盖短问短答、长输入短输出、短输入长输出和混合长度;从生产日志提取长度分布时要脱敏。预热后再测,并分别测试低并发、目标并发和过载点。

3. 同时报告质量与系统指标

类别指标
延迟TTFT、TPOT/ITL、端到端 P50/P95/P99
吞吐requests/s、input tok/s、output tok/s
稳定性错误率、超时率、OOM、队列长度
资源GPU 利用率、显存峰值、功耗
质量固定解码设置下的任务成功率或困惑度回退
成本每千次请求或每百万有效输出 Token 成本

4. 画出容量曲线

不要只报一个“最高吞吐”。逐步增加到达率,观察 TTFT/P99 在何处急剧上升,找到满足 SLO 的最大稳定负载;重复多轮并报告方差。

30 秒回答

“我会固定模型、精度、硬件和启动参数,用生产长度分布做预热后的压力测试。结果同时报告 TTFT、TPOT、P95/P99、输入/输出吞吐、错误率和显存,而不是只报 tok/s。最终选满足质量与延迟 SLO 的最大稳定负载,并把脚本、镜像和原始结果一起保存,保证可复现。”

💡 答案要点

Ollama vs vLLM 核心对比:

维度OllamavLLM
定位本地模型运行平台高性能推理服务引擎
使用方式下载即用,无需代码API 服务化部署
适用人群个人开发者、本地测试企业级生产部署
模型支持专注开源模型(Llama/Qwen等)所有 HuggingFace 模型
性能中等(本地推理)极致优化(高并发)
部署难度⭐(5分钟上手)⭐⭐⭐⭐(需要配置)

Ollama 核心优势:

bash
# 一键运行模型,零配置
ollama run llama3.2        # 运行 Llama 3.2
ollama run qwen2.5:14b      # 运行 Qwen 2.5 14B
ollama run deepseek-r1:7b   # 运行 DeepSeek R1

# API 模式
curl http://localhost:11434/api/generate -d '{
  "model": "llama3.2",
  "prompt": "解释 Transformer 架构"
}'

选型建议:

场景推荐原因
本地开发/个人使用Ollama零配置,一键运行
快速验证 POCOllama5分钟跑起来
生产环境/高并发先压测 vLLM、SGLang、TensorRT-LLM 等候选吞吐、延迟和运维要求不同
需要 API 服务化Ollama 或服务型推理框架均可根据协议兼容、并发和部署能力选择
资源受限(Mac/Windows)Ollama原生支持 Mac GPU

面试话术:

"Ollama 更强调本地模型管理和易用性,vLLM 等服务框架更强调批调度、吞吐和分布式能力,但‘开发/生产’不是绝对分界。选型要把模型、硬件、输入输出长度和并发固定后压测 TTFT、TPOT、吞吐、稳定性与运维成本。"

📚 参考:vLLM 官方 benchmarks 目录(基准测试方法)