🧠 图解记忆: 可复现基准要固定条件、公开负载、区分场景、报告尾延迟,并交付完整复现包。
💡 答案要点
1. 固定不可变条件
记录模型与 revision、dtype/量化方案、GPU 型号与数量、驱动/CUDA、框架 commit、容器镜像、并行策略和完整启动参数。
2. 使用代表性流量
至少覆盖短问短答、长输入短输出、短输入长输出和混合长度;从生产日志提取长度分布时要脱敏。预热后再测,并分别测试低并发、目标并发和过载点。
3. 同时报告质量与系统指标
| 类别 | 指标 |
|---|---|
| 延迟 | TTFT、TPOT/ITL、端到端 P50/P95/P99 |
| 吞吐 | requests/s、input tok/s、output tok/s |
| 稳定性 | 错误率、超时率、OOM、队列长度 |
| 资源 | GPU 利用率、显存峰值、功耗 |
| 质量 | 固定解码设置下的任务成功率或困惑度回退 |
| 成本 | 每千次请求或每百万有效输出 Token 成本 |
4. 画出容量曲线
不要只报一个“最高吞吐”。逐步增加到达率,观察 TTFT/P99 在何处急剧上升,找到满足 SLO 的最大稳定负载;重复多轮并报告方差。
30 秒回答
“我会固定模型、精度、硬件和启动参数,用生产长度分布做预热后的压力测试。结果同时报告 TTFT、TPOT、P95/P99、输入/输出吞吐、错误率和显存,而不是只报 tok/s。最终选满足质量与延迟 SLO 的最大稳定负载,并把脚本、镜像和原始结果一起保存,保证可复现。”
💡 答案要点
Ollama vs vLLM 核心对比:
| 维度 | Ollama | vLLM |
|---|---|---|
| 定位 | 本地模型运行平台 | 高性能推理服务引擎 |
| 使用方式 | 下载即用,无需代码 | API 服务化部署 |
| 适用人群 | 个人开发者、本地测试 | 企业级生产部署 |
| 模型支持 | 专注开源模型(Llama/Qwen等) | 所有 HuggingFace 模型 |
| 性能 | 中等(本地推理) | 极致优化(高并发) |
| 部署难度 | ⭐(5分钟上手) | ⭐⭐⭐⭐(需要配置) |
Ollama 核心优势:
bash
# 一键运行模型,零配置
ollama run llama3.2 # 运行 Llama 3.2
ollama run qwen2.5:14b # 运行 Qwen 2.5 14B
ollama run deepseek-r1:7b # 运行 DeepSeek R1
# API 模式
curl http://localhost:11434/api/generate -d '{
"model": "llama3.2",
"prompt": "解释 Transformer 架构"
}'选型建议:
| 场景 | 推荐 | 原因 |
|---|---|---|
| 本地开发/个人使用 | Ollama | 零配置,一键运行 |
| 快速验证 POC | Ollama | 5分钟跑起来 |
| 生产环境/高并发 | 先压测 vLLM、SGLang、TensorRT-LLM 等候选 | 吞吐、延迟和运维要求不同 |
| 需要 API 服务化 | Ollama 或服务型推理框架均可 | 根据协议兼容、并发和部署能力选择 |
| 资源受限(Mac/Windows) | Ollama | 原生支持 Mac GPU |
面试话术:
"Ollama 更强调本地模型管理和易用性,vLLM 等服务框架更强调批调度、吞吐和分布式能力,但‘开发/生产’不是绝对分界。选型要把模型、硬件、输入输出长度和并发固定后压测 TTFT、TPOT、吞吐、稳定性与运维成本。"
